r/LocalLLaMA に、Intel Optane Persistent Memory を使った自作PCで1兆パラメータ級のモデルを4トークン/秒超で動かしたという報告が投稿され、281件のエンゲージメントを集めた。結論から言うと、これは「速い・実用的」というより「メモリ階層の使い方が珍しい」構成として注目された事例だ。ただし今回、投稿本文はbot認証の壁で取得できず、確認できるのはタイトルとコミュニティ要約のみである点を先に断っておく。
何が報告されたか
今回素材にできたのは、投稿のタイトルとして提示された次の主張だけだ。Redditの本文(構成の詳細やベンチ条件)は取得できていない。
Computer build using Intel Optane Persistent Memory – Can run 1 trillion parameter model at over 4 tokens/sec
(Intel Optane Persistent Memoryを使った自作PC。1兆パラメータモデルを4トークン/秒超で実行できる)
ここから堅く言えるのは、1兆パラメータ規模のモデルを、GPUのVRAMだけに載せるのではなく、大容量の永続メモリ(Optane PMem)を活用してローカルで走らせたという一点である。約4トークン/秒という数字は、生成AIをストレスなく使う速度とは言い難いが、この規模のモデルを個人の自作機で「とりあえず動かせた」こと自体がコミュニティの関心を引いたと読める。
具体的なポイント
- キーは Intel Optane Persistent Memory:DRAMとSSDの中間に位置する大容量・不揮発メモリで、これを巨大モデルの受け皿に使った構成という点が主眼。
- モデル規模は1兆パラメータ:タイトルで明示されている数少ない確定情報。事前要約では「Kimi K2.5」と補足されているが、これは誤訳・補完の可能性があり、原文で確認できていないため断定はしない。
- 速度は「4トークン/秒超」:あくまで下限の表現。詳しいプロンプト長・量子化・実測条件は投稿本文が未取得のため不明。
- 投稿先はr/LocalLLaMA:ローカルLLM界隈の実験報告。281エンゲージという規模感からも、実用ベンチというより構成の珍しさで話題化した性格が強い。
まとめ
・Optane PMemを使い、自作PCで1兆パラメータモデルを4トークン/秒超で動かしたという報告。
・確定情報はタイトルのみで、モデル名・詳細構成・ベンチ条件は本文未取得のため留保。
・「速さ」より「巨大モデルをローカルで走らせるメモリ設計」の実験例として見るのが妥当。
実装家視点で言うと、この手の報告で本当に価値があるのは「4トークン/秒」という数字ではなく、VRAMを超える規模のモデルをどのメモリ階層に逃がすかという設計思想のほうだ。Optaneはすでに製品ラインとしては終息方向で入手性に難があり、そのまま真似できる構成ではない。ただ「GPUに載り切らないモデルを遅くても動かす」ニーズは今後も残るので、興味があれば元投稿の本文(今回は認証壁で読めていない)を直接当たり、量子化と実測条件まで確認してから評価するのを勧める。
元記事: https://www.reddit.com/r/LocalLLaMA/comments/1taeg8h/computer_build_using_intel_optane_persistent/


コメント