ローカルLLMに必要なPCスペックは?CPU・GPU・メモリの選び方【2026年版】

ローカルLLM用PCを選ぶとき、CPUやNPUの新しさだけで判断すると、使いたいモデルをメモリへ読み込めないことがあります。反対に、必要以上に大容量の構成を選ぶと、使わない性能に費用をかけることになります。
結論から言うと、ローカルLLM用PCでは、最初にモデル規模とメモリ容量を決め、次にGPUで利用できるメモリ、ソフトウェア対応、メモリ帯域、SSD、冷却を確認します。 4bit量子化モデルを1つ使う場合、7B~14Bなら32GB RAM、32Bなら64GB以上、70Bなら96~128GBが構成を考える目安です。
| 使いたいモデル | RAMの構成目安 | GPU側メモリの目安※ | SSDの目安 | 主な用途 |
| 7B~8B | 16~32GB | 8GB以上 | 512GB~1TB | チャット、要約、翻訳、文章作成 |
| 14B | 32~64GB | 12~16GB以上 | 1TB | コード補助、日本語文章、軽量RAG |
| 32B | 64~96GB | 24GB以上、または大容量統合メモリ | 1~2TB | 高度な推論、長文、RAG、開発 |
| 70B~72B | 96~128GB | 48GB以上、複数GPU、または大容量統合メモリ | 2TB以上 | 専門タスク、大規模RAG、AIエージェント |
※GPU側メモリは、一般的な4bitモデルの大部分をGPUへ載せる場合の構成目安です。量子化方式、モデル構造、コンテキスト長、KVキャッシュ、推論ソフトによって必要量は変わります。
ローカルAIの仕組みやミニPCを選ぶ全体手順から確認したい方は、ローカルAI・LLM向けミニPC完全ガイドをご覧ください。
ローカルLLM用PCは何を基準に選ぶ?
ローカルLLMは、モデルのデータを自分のPCへ保存し、CPU、GPUなどを使って推論を行います。モデルをクラウドへ送る必要はありませんが、モデルを読み込むためのメモリと、計算するための演算性能が必要です。
PC選びでは、次の順番で確認すると失敗を減らせます。
- 使用するモデルと量子化方式を決める
- モデル、OS、KVキャッシュが収まるメモリを確保する
- GPUで利用できるVRAMまたは共有メモリを確認する
- Ollama、LM Studio、llama.cppなどの対応状況を確認する
- SSD容量、冷却、ネットワーク、拡張性を確認する
CPU名や「AI性能○○TOPS」から先に選ぶのではなく、モデルをどこへ読み込むかから逆算するのがポイントです。
モデル規模別に見るローカルLLMの推奨PCスペック
7B~8B:初めて試すなら32GB RAMが使いやすい
7B~8Bの4bit量子化モデルは、モデル重みの単純計算では約3.5~4GBです。16GB RAMでも小さいコンテキストで試せる場合がありますが、Windows、ブラウザ、資料作成ソフトを同時に使うなら32GBのほうが余裕を持てます。
構成目安
- CPU:AVX2に対応する比較的新しいx86-64 CPU
- RAM:最低16GB、推奨32GB
- GPU側メモリ:8GB以上を目安に確認
- SSD:512GB以上。複数モデルを保存するなら1TB
- 用途:チャット、要約、翻訳、短い文書の処理
GPUがなくてもCPU推論を試せます。ただし、応答速度を重視する場合は、利用するソフトが対応するGPUと、十分なVRAMまたは共有メモリを確認してください。
14B:32GBを基準に、RAGなら64GBも検討
14Bの4bit重みは単純計算で約7GBです。実行時にはモデル以外にOS、推論用バッファ、KVキャッシュもメモリを使います。そのため、32GB RAMが現実的な開始ラインになります。
長いPDFを参照するRAG、コーディング支援、複数アプリとの併用では64GBも候補です。GPUへモデルの大部分を載せたい場合は、12~16GB以上のGPU側メモリがあると構成を検討しやすくなります。
構成目安
- CPU:8コア以上を候補にし、シングルスレッド性能も確認
- RAM:32~64GB
- GPU側メモリ:12~16GB以上を目安に確認
- SSD:1TB以上
- 用途:日本語文章、コード補助、軽量RAG、個人用AIアシスタント

32B:64GB以上とGPUメモリの割り当てを確認
32Bの4bit重みは単純計算で約16GBです。専用GPUなら24GB程度のVRAMが一つの目安になります。統合メモリ型PCでは、GPUへ割り当てられる容量と、OS用に残す容量の両方を確認してください。
32GB RAMでも設定次第で読み込めるモデルはありますが、長いコンテキストやRAGを加えると余裕が小さくなります。ローカルLLMを日常的に使うなら、64~96GBを基本に考えるほうが安全です。
構成目安
- CPU:8コア以上。RAGや複数アプリを併用するなら12コア級も候補
- RAM:64~96GB
- GPU側メモリ:24GB以上、または大容量統合メモリ
- SSD:1~2TB以上
- 用途:高度なコード生成、専門文書、RAG、ツール利用型エージェント
70B~72B:96~128GBの大容量メモリが現実的
70Bモデルの4bit重みは単純計算で約35GBです。実際にはモデル形式の付加情報、KVキャッシュ、推論用バッファ、OS、他アプリの領域が加わります。64GBで読み込める場合もありますが、長いコンテキストやRAGでは余裕が限られます。
70Bクラスを主目的にする場合は、96~128GB RAMまたは統合メモリを現実的な候補とします。専用GPU構成では48GB以上のVRAM、複数GPU、CPUとGPUの分割実行などが選択肢になります。ただし、容量の合計が同じでも、接続方式やメモリ帯域によって生成速度は異なります。
構成目安
- CPU:高性能な多コアCPU
- RAM:96~128GB
- GPU側メモリ:48GB以上、複数GPU、または大容量統合メモリ
- SSD:2TB以上
- 用途:専門的な推論、大規模RAG、複数ツールを使うAIエージェント
モデル規模ごとの計算方法は、7B・14B・32B・70Bモデルに必要なメモリで詳しく解説しています。
メモリ:容量だけでなく増設可否も確認する
ローカルLLMでは、モデル重み、KVキャッシュ、OS、推論ソフトがRAMまたはVRAMを使います。メモリ不足になると、モデルを読み込めない、コンテキストを伸ばせない、ストレージへのスワップで応答が遅くなるといった問題が起こります。
購入時は次の点を確認してください。
- 搭載RAMの容量
- 最大増設容量
- SO-DIMMかオンボードメモリか
- デュアルチャネルなどのチャネル構成
- DDR5、LPDDR5Xなどのメモリ規格と速度
- 統合メモリの場合、GPUへ割り当てられる上限
SO-DIMMは後から容量を増やせる製品があります。オンボードのLPDDR5Xは交換できないことが多い一方、高いメモリ速度や統合メモリ設計を採用する製品があります。どちらが優れているかは、将来の増設を重視するか、現在の帯域と統合設計を重視するかで変わります。
一般的なPC用途における容量差は、16GB・32GB・64GBメモリの違いも参考になります。

VRAMと統合メモリ:モデルをGPUへ載せられるか
VRAMは専用GPUが使うメモリです。モデルの多くをVRAMへ載せられると、GPUで処理しやすくなります。VRAMに収まらない部分をRAMとCPUへ分けるCPU・GPU混在推論も可能ですが、実際の速度は構成によって変わります。
統合メモリ型PCでは、CPUとGPUが同じメモリプールを共有します。大容量をGPU側へ割り当てられる製品は、大きなモデルを1台で扱う候補になります。ただし、「128GB搭載=128GBすべてをモデルに使用可能」という意味ではありません。OS、アプリ、RAG、キャッシュ用の余裕を残す必要があります。
専用VRAMと共有メモリの違いや確認方法は、VRAMとは?容量の選び方ガイドをご覧ください。
GPU:性能名よりソフトウェア対応を確認する
GPUは並列処理を得意とし、ローカルLLMの推論を高速化する中心的な演算器です。ただし、GPUの世代や理論演算性能だけでは、実際の生成速度は決まりません。
確認すべき項目は次のとおりです。
- GPUへ割り当てられるメモリ容量
- WindowsまたはLinuxでのドライバー対応
- CUDA、ROCm/HIP、Vulkanなど利用するバックエンド
- Ollama、LM Studio、llama.cppでの対応状況
- 使用する量子化形式や演算精度の対応
- モデル全体をGPUへ載せるか、CPUと分割するか
llama.cppはCPU推論に加え、NVIDIA GPU向けCUDA、AMD GPU向けHIP、Vulkanなど複数のバックエンドとCPU・GPU混在推論に対応しています。ただし、すべてのGPU、OS、モデル形式で同じ機能と速度が得られるわけではありません。
AMD環境では、ROCmの対応表を購入前と導入時に確認してください。対応するプロセッサーでも、WindowsとLinuxでは利用できるコンポーネントや既知の制限が異なる場合があります。
NPU:TOPSだけでローカルLLM性能を判断しない
NPUは、AI処理を低消費電力で実行するための専用回路です。Windowsの対応AI機能、音声・画像処理、ONNX系アプリなどで活用されます。
一方、OllamaやLM Studioへモデルを追加しただけで、すべてのLLM推論が自動的にNPUへ移るわけではありません。利用するソフト、モデル形式、実行バックエンドがNPUに対応している必要があります。
そのため、ローカルLLM用PCでは次の順番で判断します。
- モデルがRAMまたはVRAMへ収まるか
- 推論ソフトがGPUを利用できるか
- メモリ帯域が用途に合うか
- NPUを使う予定のアプリが対応しているか
CPU、GPU、NPUの役割は、NPUとGPUの違い|ローカルLLMではどちらが重要?で詳しく比較しています。
CPU:GPUを使う場合でも重要
CPUだけでもローカルLLMを実行できます。また、GPUへ載らないレイヤーの処理、モデルの読み込み、テキスト分割、RAGの検索、データ前処理、アプリ全体の制御にはCPUを使います。
購入時は、コア数だけでなく次の点を確認してください。
- 推論ソフトが必要とする命令セット
- シングルスレッド性能とマルチコア性能
- メモリチャネルと対応メモリ速度
- 長時間負荷時の消費電力と冷却
- GPUやSSDを接続するPCIe・USB4・OCuLinkなどの拡張性
LM StudioのWindows x64版はAVX2対応CPUを要件として示しています。古いPCを再利用する場合は、メモリ容量だけでなくCPUの命令セットも確認してください。
メモリ帯域:同じ容量でも動作特性が変わる
LLM推論では、生成のたびにモデルの重みを繰り返し読み出します。そのため、同じ64GBでも、メモリ規格、速度、チャネル構成によって動作特性が変わります。
ただし、メモリ帯域の数値だけから生成速度を断定することもできません。モデル構造、量子化形式、推論エンジン、GPU利用率、コンテキスト長などが同時に影響します。
製品を比較するときは、容量と帯域を分けて考えます。
- 容量:モデル、KVキャッシュ、OSが収まるか
- 帯域:読み込んだモデルをどの程度効率よく処理できるか
SSD:1TBを基準に、モデルとRAGデータの置き場所を決める
SSDはモデルの保存、読み込み、RAG用文書、ベクトルデータベース、Dockerイメージ、ログに使います。SSDだけを高速化しても推論中のトークン生成が必ず速くなるわけではありませんが、モデルの読み込みやデータ管理には影響します。
目安は次のとおりです。
- 小型モデルを数個試す:512GB~1TB
- 14B~32Bモデルを複数保存する:1~2TB
- 70B、画像生成、RAGデータも保存する:2TB以上
複数のM.2スロットがあるPCなら、OS・アプリ用とモデル・データ用でSSDを分けられます。バックアップ先も別に用意してください。
冷却・電源・ネットワーク:長時間運用では見落とせない
短い動作確認と、ローカルAPIやAIエージェントを何時間も動かす運用では条件が異なります。ミニPCを常設する場合は、吸排気口をふさがず、メーカーが示す電力モードと動作環境を守ってください。
社内の複数端末から利用する場合は、有線LAN、2.5GbE、Wi-Fi、ルーター、アクセス制御も確認します。ローカルLLMのAPIをインターネットへ直接公開せず、認証、ファイアウォール、VPNなどを組み合わせてください。
AIエージェントを常時運用する場合は、OpenClaw向けミニPCの必要スペックも参考になります。
WindowsとLinuxはどちらを選ぶ?
初めてローカルLLMを試すなら、普段使っているWindows上でLM StudioやOllamaを利用する方法が始めやすい選択肢です。LM StudioはWindows x64版で16GB以上のRAMと4GB以上の専用VRAMを推奨しています。ただし、これはアプリの開始要件であり、大きなモデルを快適に使うための推奨構成ではありません。
Linuxは、開発環境、コンテナ、サーバー運用、特定のROCm機能を重視する場合の候補です。AMDのROCmでは、WindowsとLinuxで対応する機能が同一とは限りません。OSを決める前に、使用するGPU、推論ソフト、フレームワークの最新対応表を確認してください。
用途別に見るACEMAGICミニPCの候補
以下は、2026年9月8日時点の公開製品仕様を基にした選び方です。同一条件で測定した比較ベンチマークではありません。モデルの生成速度や最大コンテキストを保証するものではありません。
7B~14Bと将来のメモリ増設:ACEMAGIC F5A
ACEMAGIC F5AのDDR5構成は、AMD Ryzen AI 9 HX 470、Radeon 890M、32GB DDR5-5600、1TB SSDを搭載し、SO-DIMMスロット×2で最大128GBまでのメモリ増設に対応します。OCuLink、USB4、デュアル2.5GbEも備えています。
32GB構成で7B~14Bから始め、RAGや複数アプリの利用に合わせてシステムメモリを増設したい人の候補です。F5AにはオンボードLPDDR5X構成もあるため、購入時にメモリ方式と増設可否を確認してください。また、システムRAMを増やすことと、専用GPUのVRAMを増やすことは同じではありません。

32B~70Bと大容量統合メモリ:ACEMAGIC M1A PRO+
ACEMAGIC M1A PRO+は、AMD Ryzen AI Max+ 395、Radeon 8060S、128GB LPDDR5X統合メモリ、2TB SSDを搭載しています。ACEMAGICの製品仕様では、最大96GBを共有VRAMとして設定可能とされています。
32B~70Bクラス、大きなRAG、複数AI処理を検討する際の大容量メモリ候補です。ただし、128GBすべてをモデルだけに使用できるわけではありません。実際に利用できるモデルと速度は、OS、ドライバー、推論ソフト、量子化、コンテキスト長によって変わります。購入時は在庫と最新仕様を製品ページで確認してください。
ほかの構成も比較したい場合は、ACEMAGICのミニPC一覧をご覧ください。
ローカルLLM用PCの購入前チェックリスト
- 使用したいモデル名とパラメータ規模を決めた
- denseモデルかMoEモデルかを確認した
- 量子化方式と実際のファイル容量を確認した
- モデル以外にOS、KVキャッシュ、RAG用の余裕を確保した
- GPUで利用できるVRAMまたは共有メモリ上限を確認した
- メモリがオンボードか、後から増設可能かを確認した
- 推論ソフトとGPUのOS別対応表を確認した
- SSD容量とM.2スロット数を確認した
- 長時間運用に必要な冷却と電源を確認した
- APIを使う場合のLANとセキュリティを確認した
- ベンチマークを比較する際、モデル、量子化、コンテキスト、OS、ソフトのバージョンが同じか確認した
まとめ:最初にモデルとメモリを決める
ローカルLLM用PCは、CPUやNPUの製品名だけで選ばず、次の順番で決めます。
- 使いたいモデルと量子化方式を決める
- 必要なRAM・VRAM・共有メモリを見積もる
- GPUと推論ソフトの対応を確認する
- メモリ帯域、SSD、冷却、ネットワークを確認する
- 将来のモデル拡大に合わせて増設可否を確認する
目安として、7B~14Bなら32GB、32Bなら64GB以上、70Bなら96~128GBが検討ラインです。長いコンテキスト、RAG、複数モデル、AIエージェントを利用する場合は、さらに余裕を持たせてください。
小型モデルから始めたい場合は32GB構成、将来メモリを増やしたい場合はSO-DIMM対応構成、大型モデルを1台で扱いたい場合は大容量統合メモリ構成が候補になります。必要スペックを決めてから、ローカルAI・LLM向けミニPC完全ガイドで製品タイプと導入方法を確認してください。
ローカルLLM用PCに関するよくある質問
ローカルLLMには最低何GBのメモリが必要ですか?
小型の4bit量子化モデルを試すだけなら16GBで動く場合があります。Windowsやブラウザを同時に使い、7B~14Bを実用的に試すなら32GBが選びやすい構成です。32Bでは64GB以上、70Bでは96~128GBを目安にします。
ローカルLLMにはGPUが必須ですか?
必須ではありません。CPUだけでも動作するモデルと推論ソフトがあります。ただし、生成速度を重視する場合は、対応GPUへモデルの多くをオフロードできる構成が有利です。
NPU搭載PCならLLMが速くなりますか?
必ず速くなるわけではありません。推論ソフト、モデル形式、ドライバーがNPUに対応している必要があります。一般的なローカルLLMでは、GPUとメモリ容量を先に確認してください。
32GBメモリで14Bモデルを使えますか?
4bit量子化、1モデル、短~中程度のコンテキストなら現実的な候補です。長い文書を扱うRAGや複数アプリとの併用では64GBも検討してください。
64GBメモリで70Bモデルを動かせますか?
4bit量子化モデルを短いコンテキストで読み込める場合はありますが、64GBは余裕の少ない下限です。OS、KVキャッシュ、RAG、他アプリを含めると、96~128GBのほうが安定運用を考えやすくなります。
VRAMが足りない場合、RAMを使えますか?
llama.cppなどはCPUとGPUへ処理を分けられます。ただし、専用VRAMとシステムRAMを単純に足した容量だけで性能は決まりません。GPUとRAM間の転送やメモリ帯域によって速度が下がる場合があります。
SSDを高速にするとLLMの回答も速くなりますか?
モデルの読み込み時間には影響しますが、モデルがメモリへ読み込まれた後の生成速度がSSDだけで大きく向上するとは限りません。推論中はGPU、CPU、メモリ帯域の影響が大きくなります。
ゲーミングPCをローカルLLMに使えますか?
利用できます。GPUのVRAM容量、システムRAM、推論ソフトの対応を確認してください。ゲーム性能が高くても、VRAM容量が目的のモデルに足りなければ、モデル全体をGPUへ載せられない場合があります。
WindowsとLinuxはどちらがおすすめですか?
初心者やGUI中心ならWindowsが始めやすく、開発、コンテナ、サーバー運用、特定のROCm機能を重視するならLinuxが候補です。最適なOSは、使用するGPUとソフトウェアの対応状況で決めてください。












コメントを投稿
コメントは公開される前に承認される必要があるので、ご注意ください。