交互式世界模型对比:能控制相机、物体、多玩家还是机器人动作?
四篇 2026 论文把交互式世界模型拆成四种接口:Kairos 单卡可跑,WALL-WM 按事件切监督,Gamma-World 多人 24 FPS,WorldCraft 加物体操作。
一句话答案
「交互式世界模型」现在至少指四种不同的接口,而 2026 年代表这四条路的几篇论文几乎不共享评测。把它们分开的不是”视频生成得多好”,而是”你能对这个世界做什么”:
- Kairos,能真正部署的原生世界模型栈:4B 参数,PAI-Bench 拿到 80.84,单张 RTX5090 上 11.4 秒生成一段 480P rollout。
- WALL-WM,面向真机的世界动作模型:按语义事件切分训练信号,多样化真机操作 Task Progress 75.86,而 pi0.5 是 55.64;泛化差距更大(53.75 对从头训的 18.50)。
- Gamma-World,多玩家视频世界模型:同一画面里模拟多个可操控角色,蒸馏后的学生模型 24 FPS 流式生成,只训练了两个玩家却能直接跑四个。
- WorldCraft,给相机控制的世界模型加物体操作:点选物体、拖出轨迹,控制信号走约 50M 参数的 LoRA,相机控制器不受影响(RPE rotation 0.131;全量微调会劣化到 0.237)。
这四个数字彼此不可比:PAI-Bench、真机 Task Progress、FVD、像素轨迹误差测的是四件事。可比的是每篇论文的设计动作和它买下了哪个失效模式。这一页就按这个结构展开。
关键数字
| 能控制什么 | 规模 / 成本 | 代表数字 | 评测类型 | |
|---|---|---|---|---|
| Kairos | 动作条件驱动的场景动态 | 4B;时间轴 O(n) 注意力;480P rollout 单张 RTX5090 11.4s、4×A800 3.0s | PAI-Bench 80.84(通用)/ 80.03(机器人);WorldModelBench 8.94 | 世界模型榜单 |
| WALL-WM | 真机末端执行器,按语义事件分块 | 共享事件预训练去噪器;统一模式外加一个 Qwen3.5-9B VLM | 多样化操作 75.86 vs pi0.5 55.64;泛化 53.75 vs 18.50 | 内部真机测试 |
| Gamma-World | 同一场景里多个键盘操控玩家 | 蒸馏 block-causal 学生 + KV cache,24 FPS;训练用 32 张 GB200 | consistency split FVD 280.0 vs Solaris 443.1;表 1 全部 FVD/FID 列第一 | 视频生成指标 |
| WorldCraft | 相机路径 + 点选拖动的物体轨迹 | 冻结相机骨干上的约 50M SP-LoRA | 轨迹误差 38.90px vs DragAnything 39.86;相机 RPE rotation 0.131 | 轨迹 + 相机保真集 |
先看最右列。Kairos 和 Gamma-World 按与参考视频的分布相似度打分,WALL-WM 按真机有没有完成任务打分,WorldCraft 按你拖的物体有没有到你想让它去的地方。跨这四者排一个”最强世界模型”榜单是没有意义的;按”你需要哪种接口”来选才是诚实的问法。
Kairos:把可部署性做成核心卖点
Kairos 的赌注是混合线性时间注意力:把时序记忆拆成三支:滑动窗口管局部动态、膨胀窗口管中程结构、带 delta 规则更新的门控线性注意力当持久全局记忆。这把 rollout 成本从 O(n²) 降到 O(n),正因如此一个 4B 模型才能以 80.84 领先 PAI-Bench(机器人变体 80.03),压过 2B 和 14B 的 Cosmos 2.5,同时还能跑在消费级显卡上。论文附了一个形式化结论(定理 2):若全局记忆分支的更新收缩因子 ρ 小于 1,长程误差有界而不是无限累积,但 ρ 是学习出来的经验性质,论文没有在训练好的权重上实测它。这个界保证误差不爆炸,不保证误差小。
WALL-WM:按事件切监督,而不是按时钟
WALL-WM 针对的是 VLA 的粒度错配:大多数模型预测固定长度动作块,把语言、视觉、控制硬塞进同一个窗口,训练退化成短程相关性拟合。WALL-WM 把视频、动作、字幕在同一语义事件边界切开再训练。最关键的数字来自真机:事件模式多样化操作 75.86 对 pi0.5 的 55.64;最干净的证据是消融:架构不变,仅换事件级监督,推理操作从 32.6 提到 71.6,泛化从 22.0 提到 53.75。诚实的保留意见:在接触密集的灵巧插入任务上,事件模式几乎没赢过从头训的基线(32.00 对 31.25),而且所有数字出自内部测试与自定义评分细则。瓶颈在任务拆解和泛化、不在接触精度时,事件边界这个思路最值得搬。
Gamma-World:翻过两人墙
Gamma-World 是四者中唯一一个天生多智能体的。此前的双人系统 Solaris 靠对所有 agent token 做稠密全注意力加按槽位的学习式 ID 嵌入,玩家数一多成本平方增长,加一个玩家就要重训。Gamma-World 用 Simplex 旋转编码把 agent 放在旋转角空间正单纯形的顶点上,几何上每对玩家等价,不是靠数据学出来的;再用 Sparse Hub Attention 让信息走少量可学习的枢纽 token,跨 agent 成本从平方降到线性。回报是一种其他系统没有的性质:训练两个玩家,推理直接跑四个,无需重训。consistency split 上 FVD 280.0 对 Solaris 的 443.1,FVD 大致砍半,五个协议的全部 FVD/FID 列都第一,蒸馏学生 24 FPS 流式生成且接近教师质量。局限也清楚:定量评测基本只有 Solaris 一个对手加一个很弱的帧拼接基线,四人就是测过的上限,32 张 GB200 的训练成本不是小实验室玩得起的。
WorldCraft:不重训相机模型,加物体操作
WorldCraft 从一个只能飞相机、碰不了东西的世界模型出发,加了三件套:Normalized World Trajectory 用单目深度把你的二维拖动抬到相机不变的世坐标再逐帧重投影(消融:小旋转下轨迹误差 30.82,像素坐标版 35.82);约 50M 参数的 Spatial-Pathway LoRA 把控制信号注入冻结骨干,全量微调会把相机 RPE rotation 从 0.131 劣化到 0.237,适配器是保住相机的关键;Trajectory-Anchored State Persistence 在物体离开画面后维持它的世界状态,253 帧长程上 combined RPE 0.0233。头条轨迹数字本身赢得克制(38.90px 对 DragAnything 的 39.86),克制的意义在于:物体操作几乎免费地加到了现成相机模型上。结构性局限:控制粒度是 16×16 像素的 latent token,小物体根本点不中;相机大角度转动时单目深度退化,恰是世坐标重投影最需要它的时候;TASP 只维持你显式动过的物体,不模拟屏幕外的世界动态,这和记忆增强世界模型攻击的长程状态问题是同一个问题的不同切面。
怎么选
- 要当 rollout 底座、在乎每步成本:Kairos。线性时间注意力是四者中唯一的复杂度主张(O(n) 对 O(n²)),也是唯一给出消费级显卡延迟数字的。
- 在训机器人策略、失败主要在组合泛化:WALL-WM。它最宽的差距在泛化(53.75 对 18.50),且消融把监督方式单独隔离了出来,可以只搬思路不搬全家桶。
- 要模拟多个协作或对抗的智能体:Gamma-World。只有它把玩家数做成运行时参数,“训二跑四”是本页最强的泛化声明。
- 已有相机控制视频模型、想加操作:WorldCraft。SP-LoRA(约 50M 参数、骨干冻结)就是为升级现有系统设计的,它的消融表也写清了跳过适配器会坏什么。
四者都没给你的是:一个它们同场竞技的公开基准。拿 FVD 去比 pi0.5 的 Task Progress 不是对比,是范畴错误。关于世界模型何时能替代语言模型推理当底座的大辩论,见 World Models vs LLMs。
局限与存疑
三个横切的缺口在四篇论文里都出现了。其一,评测割裂:各报各的榜,这个领域没有能经得住数据的”最强世界模型”答案。其二,长程诚实度:Kairos 的界依赖未实测的收缩因子,WorldCraft 的状态维持只管用户指定的物体,Gamma-World 四人就是上限,WALL-WM 的事件配方在接触密集任务上不赚。其三,成本口径不一:只有 Gamma-World 报训练规模(32 张 GB200),只有 Kairos 报推理延迟不报训练成本,WALL-WM 两者都没报,只有 WorldCraft 披露了数据配方(27,027 条片段)。想照这四篇论文做预算的人,是在缺失的数字之间插值。
常见问题
如何选一个能跑在单张消费级显卡上的世界模型?
Kairos:混合线性时间注意力对序列长度是 O(n),单张 RTX5090 生成一段 480P rollout 要 11.4 秒,这是四个系统里唯一的消费级延迟数字。
WALL-WM 对比 pi0.5 强多少?
在论文的真机多样化操作测试上,事件模式 Task Progress 75.86,pi0.5 为 55.64。差距最大的是对随机指令和新场景的泛化:53.75 对从头训的固定长度基线 18.50。两者都出自内部测试与自定义评分,请当作指示性数字看待。
视频世界模型如何支持两个以上的玩家?
Gamma-World 证明了训练两个玩家后可直接跑四个。Simplex 旋转编码是无参数、置换对称的,玩家数量不进权重;consistency split 上 FVD 280.0 对 Solaris 的 443.1,同时保持 24 FPS 流式生成。
有哪些方法给相机世界模型加物体操作而不损伤相机质量?
走小适配器就几乎不会。WorldCraft 约 50M 参数的 SP-LoRA 把相机 RPE rotation 维持在 0.131,同样控制用全量微调会劣化到 0.237。注意这是纯相机评测,准确的说法是”相机控制器保住了”,而不是”物体操作在视觉上零代价”。
为什么这四篇论文不能用同一基准对比排名?
它们在不同任务上报不同指标:Kairos 报 PAI-Bench 榜,WALL-WM 报真机 Task Progress,Gamma-World 报 Minecraft 风格场景的 FVD/FID,WorldCraft 报像素轨迹误差加相机 RPE。每个指标对它自己的接口问题都是对的,但彼此之间不可换算。