Gemma 2 JPN WebGPUを試す

 ブラウザ上でLLMが動くというので、リソースに少し余裕のあるM3 MBA上で、ちょっと試してみる。

 Gemma 2 JPN WebGPU

 https://huggingface.co/spaces/webml-community/gemma-2-2b-jpn-webgpu

 WebGPUを使うので、FirefoxやSafariでは動かない。

 Chromeで実行する。

 2.5GBがキャッシュされるって、結構つらくね?

 Transformers.jsとONNX Runtime Webを使ってローカル実行される。ロードしたらネット切ってもいいと書かれている。

 ソースはこちら。

 transformers.js-examples/gemma-2-2b-jpn-webgpu at main · huggingface/transformers.js-examples · GitHub

 https://github.com/huggingface/transformers.js-examples/tree/main/gemma-2-2b-jpn-webgpu

 Load Modelボタンを押すとダウンロードがはじまる。結構時間がかかるな。

 完了。

 あとは、普通にチャットするだけ。

 Enterで質問を開始してしまうので、ちょっとめんどくさい。2Bなので、かなりアホ。

 最初は威勢がいいのだけれど、メモリが足りないのか、応答がだんだん遅くなってきた。

 遅くなっても、そんなにメモリは食っていない。

 ブラウザを閉じるて再度開くとロードボタンが表示される。ローカルを確認していないのか、閉じると削除されるのか。たぶん、ローカルキャッシュにはいるんだろうな。念のため、消しておく。

 Chromeって特定のキャッシュを消すの面倒だわ。サイトを開いた状態で、DevToolsから、Run Commandを開いて、siteを検索すると出てくるClearを押す。

 まぁ、できるといっても、アウトプットはまだまだですねw


オリジナル投稿:
Gemma 2 JPN WebGPUを試す|kinneko|pixivFANBOX
https://kinneko.fanbox.cc/posts/9059751