瀏覽單個文章
野口隆史
Elite Member
 
野口隆史的大頭照
 

加入日期: Mar 2001
您的住址: Rivia
文章: 7,077
引用:
作者substar999
依照What Do You See的說明,
看起來這玩意應該可以直接在windows上使用,
配合我先前建置好的本地AI環境即可執行。
有空來玩玩看。
話說野口兄有使用Gemma4-26B-A4B搭配Hermes跑任務嗎? 效果如何?
最近總有人在說千問的MOE模型有多好,但手上的機器算力實在太弱(單純就RAM多),
有打算砸錢入手Strix Halo 395來試試。

服務目前使用 WebGPU 使用指定模型進行推理測試
本地目前僅支援 llama.cpp

Hermes 我有用,也長時間搭配 Gemma4 26B
如果你目前還在用,沒更新過聊天模板建議更新,有修復一些工具調用的問題
https://huggingface.co/google/gemma..._template.jinja

Strix Halo 目前的價格其實不是很理想
尤其是 m5 ultra 出了之後
目前 cp 值最高的是 m5 ultra 256GB
如果真的一定現在買一台
就買 m5 ultra
或者等等看 RTX Spark 出會不會有價格變化
但我不太建議等,可能越等越貴


引用:
作者巴豆布妖
我用 gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf
用在 C/C++ 等等寫程式的經驗是, 它偶爾會一直重覆 Tool call, 這點 Qwen 不會
然後洗車問題一直老叫我走路去洗車 對於 "目的推理" 偶爾會趴帶

你也可以用 NVIDIA-Nemotron-3.5-Lightning-30B-A3B, 但它也是叫我走路去洗車
它不追求最高 benchmark, 而是追求 長 context + 高效率 + Agent/工具場景
https://iili.io/n32Lnzg.md.png (https://freeimage.host/i/n32Lnzg)

工具調用問題可以更新聊天模板,如果你沒更新過的話
然後有千問就真的不建議使用 Gemma 編碼,兩者不是同一級別的
__________________
Folding@home with GPGPU集中討論串

Unix Review: ArchLinuxSabayonOpenSolaris 2008.5Ubuntu 8.10
AVs Review: GDTCAntiVir SSESSKIS 09NIS 09Norton 360 V3

I Always Get What I Want.
舊 2026-09-08, 10:34 AM #10
回應時引用此文章
野口隆史離線中