序
6GB~8GBのモデルでQwen 3.8 27B相当の実力を発揮するという Ternary Bonsai 2 27B がリリースされたけど試すには改造版llama.cppが必要ということで対応待ちでした。 公式対応の前にバックエンドエンジンの追加でLM Studioで動かせるのが出てたので試してみました。
通常版
NOXZURE/llama.cpp-PrismML-Fork-LmStudio github.com
(Githubにファイルが置かれているだけでオープンソースではないのでセキュリティ的に注意が必要な案件です)
Releasesにあるllama.cpp-prism-b10709-9a9394a-bin-win-cuda-13.3-x64-lm-studio.zipを展開して
%USERPROFILE%\.lmstudio\extensions\backends (C:\Users\ユーザー名\.lmstudio~)にフォルダを放り込むだけ。
LM Studioを起動して Settings の Runtime の GGUF の右側のプルダウンから Prism ML CUDA 13.3 llama.cpp (Windows...) を選択。
モデルは prism-ml/Ternary-Bonsai-2-27B-gguf から選びます。
PTQ1.0とPQ2.0があって2.0のほうが高性能だけど重いからスペックに応じて選ぶみたいな?
あとは通常通りモデルをロードしてチャット。
速さ優先でReasoningをオフ。
かつてないほどAIがキビキビ応答します。
前のBonsaiは性能が残念だったけどこれは良い感じですぞ。
Uncensored版
既にHeretic版が出てますね。
Vision対応のものはこのあたりかな OS-Software/Ternary-Bonsai-2-27B-Uncensored-Heretic-GGUF
これも動きました。
所感
ComfyUIでもプロンプト拡張用に使いたい