视频世界模型正迎来从单人视角向多人协作的底层变革。传统的视频世界模型大多建立在单智能体假设之上,难以应付多个玩家在同一虚拟世界中同时操作、互相观察的复杂场景。为了打破这一架构瓶颈,英伟达联合清华大学、多伦多大学及 Vector Institute 正式发布了名为 Gamma-World(γ-World)的全新多智能体世界模型方案。
多智能体世界建模的核心难点在于同时维护时间、跨视角以及交互的三重一致性。以往的研究如 Solaris 虽然在双人协同上取得了进展,但暴露出身份编码破坏置换对称性、全连接注意力机制导致计算量随人数平方级暴涨这两大核心缺陷,无法真正扩展到更多主体。