VRAM不足でどうなる?重いローカルLLMの動作検証と感想

当ページのリンクには広告が含まれています。
VRAM不足でも動く?!17GBモデルを8GBグラボで限界検証

別の記事で、自分のPCスペックに合ったローカルLLMを見つけ、実際にインストールして使ってみましたが、「もっと性能の良いローカルLLMを使ってみたい!」という気持ちが湧き上がり、ガマンができなくなってしまいました。

そこで今回は、自分のPCスペック(VRAM:8GB)を大きく超えるローカルLLMを実際にインストールして試した結果を紹介します。

結論を先にお知らせします。

VRAMが足りなくても、メインメモリをたくさん積んでいれば、なんとかなります!

「他サイトで『VRAMが不足していると極端に遅くなる』って書いてあったけど?」
「本当は、動かないんじゃないの?」

そう思われた方も多いと思います。

もちろん、無条件でなんとかなる訳ではありません。
この記事を最後まで読んでいただければ、「どのくらいまで大丈夫なのか」も分かります。

私が実際に試した順に紹介しますので、最後までお付き合いください。

目次

インストールするローカルLLMの選定

まずは、インストールするローカルLLMを決めなくては始まりません。
以下の記事でインストールした「whichllm」コマンド uvx whichllm@latestを実行して、インストールするローカルLLMを決めます。

なお、「whichllm」の使い方や表示内容の見方は、以下の記事で詳しく紹介しています。

「whichllm」の実行結果は、以下の通り。

whichllmコマンドの実行結果

ここで私が今回インストールすることに決めたのは、3位の「Qwen3-30B-A3B」です。

「whichllm」を使って、自分のPCで動かせるローカルLLMを選別しているので1位を選べば良いのですが、私が気になったのは、Quant(量子化)の欄です。

Quant(量子化)は、「Q4_K_M」が、元のAIと比べて賢さの低下が少なく、データ容量も劇的に小さくなるため、「最もバランスが良い標準設定」とされていますが、1位は「Q3_K_M」、2位は「Q5_K_M」。

「試し」だからといって、精度は何だって良い訳ではありません。

あくまでも「実用に耐える精度のものが、VRAMをオーバーしても使えるのか?」が知りたくて、こんな実験をする訳ですし、「うまくいけば、そのまま使い続けたい」という打算もあるので、「Q4_K_M」である3位の「Qwen3-30B-A3B」をインストールすることに決めました。

また、私のPCのVRAMが8GBなのに、「Qwen3-30B-A3B」に必要なVRAMの容量(Fit/VRAM欄)が、倍以上の17.4GBなのも、今回の検証モデルにピッタリです。

「Qwen3-30B-A3B」をLM Studioにインストールする

私のPCには、すでにLM Studioがインストールされているので、LM Studioに「Qwen3-30B-A3B」をインストールします。

もし、LM Studioのインストール方法から知りたい方は、以下の記事をご覧ください。

STEP
左側のメニューにある、ロボットと虫眼鏡のアイコンをクリック

STEP
検索窓で「qwen3-30b-a3b」と入力(英語は小文字で入力すること)

STEP
右側に表示されたモデルが、目的のモデルであることを確認して、「Download」をクリック
ローカルLLMモデルのダウンロード画面

「無名チャット」が開き、チャットエリアの上に「qwen/qwen3-30b-a3b-2507」と表示されて完了。

もし、無名チャットの上にモデル名が表示されていない場合は、その場所をクリックしてください。
インストール済みのモデルが一覧で表示されるので、目的のモデルをクリックすれば、反映させられます。

LM Studioで無名チャットを開いてるところ

動作検証の準備

「Qwen3-30B-A3B」の動作検証をする前に、動作検証の準備として、以下のものを起動しました。

  • LM Studio
  • テストプロンプトの書かれたテキスト(テキストエディタ)
  • 検証用コマンド(端末(ターミナル))
  • 記録用Googleドキュメント(Google Chrome)

テストプロンプトは、前に「LFM2.5」の動作検証の時に使ったプロンプトと同じものを使います。

テスト1:日本語の自然さ(日常の挨拶や世間話)
テスト2:実用性チェック(メールの下書き作成)
テスト3:実用性チェック(文章の要約)
テスト4:出力スピードとレスポンスの快適さ

検証用コマンドも、「LFM2.5」の動作検証の時に使ったコマンドを使います。

「Qwen3-30B-A3B」の動作検証

これで準備が整ったので、新しい無名チャットに、4つのテストプロンプトを順番に実行していきました。

4つとも同じような結果で、思考時間はだいたい2秒前後。回答も自然な文章で、前回試したLFM2.5よりも詳しく、多くの情報が書かれていましたが、回答の出力スピードは遅くなりました。

とはいえ、自分が読むスピードよりも少し速い程度の出力スピードだったので、見た目は少しモッサリした感じでしたが、ストレスを感じるようなことはありませんでした。

実際に実行したテストプロンプトの回答は、以下の通り。

テスト1:日本語の自然さ(日常の挨拶や世間話)

テスト1の結果(前半)
テスト1の結果(後半)

装飾が多いですが、特に変な日本語はありませんでしたし、表現に違和感を感じるところもありませんでした。
「ポイント」として、心理的なフォローも書かれており、わかりやすい内容となっていました。

テスト2:実用性チェック(メールの下書き作成)

テスト2の結果(前半)
テスト2の結果(後半)

メールの下書きについては、個人的には、回りくどい書き方で、あまり良い文章とは思えませんでした。

ただ、ビジネス用の言い回しなどは特に問題ないように感じました。

今回はテストなのでやりませんでしたが、「結論がわかりやすいように、先に書いて」とか何回かやりとりすれば、良いメール文章になると思いますし、AIとのチャットのやりとりの冒頭としては「こんなもんだろう」という内容です。

回答の最後に、こちらの体調の心配まで書いてあるのは、AIらしい文章だなあと感じました。

テスト3:実用性チェック(文章の要約)

テスト3の結果

テスト1・2と違って余計な文章はなく、要約のみ表示されました。

内容に間違いはないのですが、これまでの雰囲気と違う文章で、ちょっと驚きました。

テスト4:出力スピードとレスポンスの快適さ

テスト4の結果(前半)
テスト4の結果(後半)

ここでまた、テスト1・2と似た書き方に戻りました。

内容も悪くありません。一番、ブログ記事に近い書き方になっていると感じます。

テストプロンプト実行時のシステム状況の確認

4つのテストプロンプトを実行し、動作に特に大きな問題はありませんでした。
これは、思考・応答の速さだけでなく、内容についても言えることで、「普通に使える」レベルです。

ネットで調べたときには、「VRAMからあふれると、スピードや精度が極端に落ちる」と書かれていました。

「なにかおかしい。」

そう思い、「なぜQwen3が普通に使えたのか」に焦点をあてて、テストプロンプト実行時のシステムの状況を確認しました。

検証用コマンドの結果が予想外に軽い

事前に動かしておいた検証用コマンドには、CPU使用率、VRAMの使用量、メインメモリの使用量が2秒おきに記録されているので、それをまず確認しました。

まずは、スクショ画像から。
画像内の赤枠の中が、テストプロンプト実行時で一番数値が高かったところです。

■テスト1実行時

テスト1実行時システムモニター

■テスト2実行時

テスト2実行時システムモニター

■テスト3実行時

テスト3実行時システムモニター

■テスト4実行時

テスト4実行時システムモニター

結果をまとめると、以下の通り。

テストCPU使用率VRAM使用量メモリ使用量
テスト138%5.81GB5G
テスト240%5.81GB5G
テスト338%5.84GB5G
テスト439%5.81GB5G

「whichllm」で表示されたQwen3のVRAMの使用量は、17.4GB。

VRAMとメインメモリを合計しても、使用量は11GBありません。

「おかしい。絶対におかしい。」
「この数値を、そのまま信じてはいけない。」

数値に違和感を覚え、さら調査を進めることにしました。

違和感の原因はキャッシュにあり!

テストプロンプト実行時のシステム状況の数値に違和感を覚え、ネットでさらに調べてみたところ、「メインメモリのキャッシュに大量のデータが保管されている。」という情報を目にしました。

そこで、btopコマンドを使って、メインメモリのキャッシュの状況を調べてみました。

btopでメモリの使用状況を確認

すると、21.2GiB(約22.7GB)ものキャッシュがあることが分かりました。

そして、メインメモリの空き容量(Free)が、たった6%(約1.85 GB)しかありませんでした。

もう、カッツカツです。

本来、メモリの使用できる領域を正しく見るためには、Availableの数値を見る必要があります。
Availableは、Freeの空き容量に、削除して別の処理に使用できるキャッシュ領域などをプラスした容量なのですが、ローカルLLMでキャッシュにある部分が削除されたら、どう影響があるかわかりません。

そうなると、実質、他の作業で使えるのはたった1.85GB。

たまたま、私のPCのメモリが32GBあったので、ギリギリQwen3が普通に動いたということです。

逆に、「VRAMが8GBでも、メモリが32GBあれば、17.4GBのVRAMが必要なローカルLLMでも、なんとか普通に使える。」とも言えます。

この結果から、「VRAMが足りなくても、メインメモリをたくさん積んでいれば、なんとかなる!」という結論にいたりました。

【おまけ】キャッシュも確認できる検証用コマンドを作ってみた

ここまでの調査で、メインメモリのキャッシュも確認しないと、ローカルLLMのシステム使用状況を把握することができないことがわかりました。

そこで、Geminiに相談して、検証用コマンドを、メインメモリのUsed、Cached、Free、Availableも表示できるように修正してみました。

実際に動かしてみると、以下のように表示されます。

検証用コマンド修正版を実行したところ

もし良ければ、以下のコマンドをコピペしてお使いください。

<検証用コマンド修正版>

while true; do echo "$(date +%H:%M:%S) CPU_$(top -bn1 | grep "Cpu(s)" | awk '{printf "%.2f", 100 - $8}')% GPU_$(nvidia-smi --query-gpu=memory.used --format=csv,noheader,nounits | awk '{printf "%.2f", $1/1024}')GB RAM/ $(free -m | awk 'NR==2{printf "Used_%.2fGB Cached_%.2fGB Free_%.2fGB Available_%.2fGB", $3/1024, $6/1024, $4/1024, $7/1024}')"; sleep 1; done

まとめ

今回は、自分のPCスペック(VRAM:8GB)を大きく超える17.4GB相当のローカルLLM「Qwen3-30B-A3B」を実際に動かした検証結果を紹介しました。

検証の結果、「VRAMが足りなくても、32GBクラスのメインメモリがあれば、キャッシュを使って普通に実用可能である」という結論に達しました。

ただし、メインメモリを21GB以上もキャッシュとして消費するため、一般的な16GBメモリのPC環境で同じことを行うと、メモリ不足でシステムがフリーズする可能性が高いです。

「VRAM 8GBのグラボで、賢い大型AIモデルをサクサク動かしたい!」という方は、

  • メインメモリを32GB以上に増設
  • VRAM 16GB以上を搭載した最新のグラフィックボード・AI対応PCへのステップアップ

を強くおすすめします。

無茶な検証ではありましたが、ローカルLLMがPC内でどのように動作しているのかを知る良い体験となりました。

気になる方は、ぜひ自己責任のもとで試してみてください!

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
目次