ブラウザ上でLLMが動くというので、リソースに少し余裕のあるM3 MBA上で、ちょっと試してみる。

Gemma 2 JPN WebGPU
https://huggingface.co/spaces/webml-community/gemma-2-2b-jpn-webgpu

WebGPUを使うので、FirefoxやSafariでは動かない。

Chromeで実行する。
2.5GBがキャッシュされるって、結構つらくね?
Transformers.jsとONNX Runtime Webを使ってローカル実行される。ロードしたらネット切ってもいいと書かれている。
ソースはこちら。
transformers.js-examples/gemma-2-2b-jpn-webgpu at main · huggingface/transformers.js-examples · GitHub
https://github.com/huggingface/transformers.js-examples/tree/main/gemma-2-2b-jpn-webgpu
Load Modelボタンを押すとダウンロードがはじまる。結構時間がかかるな。

完了。

あとは、普通にチャットするだけ。

Enterで質問を開始してしまうので、ちょっとめんどくさい。2Bなので、かなりアホ。

最初は威勢がいいのだけれど、メモリが足りないのか、応答がだんだん遅くなってきた。

遅くなっても、そんなにメモリは食っていない。

ブラウザを閉じるて再度開くとロードボタンが表示される。ローカルを確認していないのか、閉じると削除されるのか。たぶん、ローカルキャッシュにはいるんだろうな。念のため、消しておく。
Chromeって特定のキャッシュを消すの面倒だわ。サイトを開いた状態で、DevToolsから、Run Commandを開いて、siteを検索すると出てくるClearを押す。

まぁ、できるといっても、アウトプットはまだまだですねw
オリジナル投稿:
Gemma 2 JPN WebGPUを試す|kinneko|pixivFANBOX
https://kinneko.fanbox.cc/posts/9059751

