「物を落とせば落ちる」のような世界のしくみをAIが内部にシミュレーションとして持つ考え方。動画生成やロボット、自動運転のカギとされる次のフロンティア。
言葉のパターンを学ぶLLMに対し、ワールドモデルは「世界がどう動くか」を学びます。目の前の状況から少し先の未来を頭の中で再生できるので、ロボットが試行錯誤なしで動けたり、ゲームのような仮想世界を丸ごと生成できたりします。
動画生成AIが物理的に自然な映像を作れるようになってきたのは、この能力の芽生えだと言われています。「言葉が話せるAI」の次は「世界がわかるAI」——研究者たちが今いちばん熱く議論しているテーマのひとつです。
「言葉が話せるAIの次は、世界がわかるAI」と書きましたが、その読みを裏づける動きが2026年9月28日にありました。半導体大手のAMDが、フェイフェイ・リー氏の創業したWorld Labsを約82億ドル(全額株式)で買収することで合意したと発表したのです。同社は「空間知能(spatial intelligence)」を掲げ、文章・画像・映像から、中を動きまわれる3次元の空間を生成したり、作り直したり、シミュレーションしたりするモデルを開発してきました。ロボットの学習やシミュレーションの技術も持っています。金額はAMDにとってXilinx(約500億ドル)に次ぐ規模で、2026年内の完了を見込むとされています(規制当局の承認が条件)。
注目されたのは金額だけではありません。リー氏は、画像認識の研究を一気に進めた巨大データセットImageNetの生みの親で、AMDでは上級副社長兼チーフサイエンティストとして、リサ・スーCEOの直属に就くとされています。半導体メーカーが「世界のしくみを扱うモデル」を自前で抱えにいった——ここに意味があります。チップを作る側が次にどんな計算が必要になるかを知るには、モデルの側を持つのが早い。ワールドモデルが研究テーマから産業の土台へ移りつつあることを示す一件です。
LLMは言葉のパターンを学びますが、ワールドモデルは「世界がどう動くか」という物理や因果のシミュレーションを内部に持ちます。ロボットや自動運転、動画生成の品質向上に不可欠とされます。
言葉だけの学習では「コップを倒せば水がこぼれる」といった身体的な常識に限界があるためです。言語の次のブレイクスルー候補として研究投資が集中しています。
重なりの大きい言葉です。ワールドモデルは「世界がどう動くか」を内部に持つ考え方全般を指し、空間知能はそのうち「空間をどう捉え、どう生成するか」に軸足を置いた呼び方です。2026年9月にAMDが買収したWorld Labsは、後者を掲げて3次元の空間を生成・再構成するモデルを開発してきました。
用語を覚えるより、ストーリーで体感するほうが早い。