Overview
World Model 是 AI Agent 的环境建模能力——预测行动后果、模拟状态转移、支持 counterfactual planning。从 MBRL 的 transition model 到 Video Generation 的 action-conditioned prediction,再到 GUI/Web Agent 的 environment simulator,不同社区对”world model”有不同理解。
核心洞察:2604-AgenticWorldModel Survey 提出的 “Levels × Laws” taxonomy 是当前最系统的框架:
- 能力层级:L1 Predictor(单步转移)→ L2 Simulator(多步 rollout)→ L3 Evolver(自主修正)
- 约束域:Physical(物理定律)/ Digital(软件逻辑)/ Social(社会规则)/ Scientific(科学规律)
术语注记:2608-WorldProxy 复用了同一套 L1/L2/L3 记号,但含义是对 agent 的介入深度(L1 推理期提示 / L2 训练期信号 / L3 agent-proxy 共演化),与此处的内在能力刻度正交(其原文自述 “rhyme without being identical”)。本文凡写 L1/L2/L3 均指 Chu 的能力刻度;需引用介入深度时写 Proxy-L1/L2/L3,避免两套刻度混淆。
整体趋势(2024-2026):
- Engineering-heavy,insight-light。HybridMemory、MultiWorld、GenerativeWorldRenderer 都是工程整合,缺少改变问题 formulation 的核心 idea
- 唯一亮点是 SpatialEvo 的 DGE 设计——用确定性几何替代 model voting
- 新发现:World-R1 用 RL(Flow-GRPO)对齐 video generation 与 3D 约束;dWorldEval 用 progress token 编码任务完成状态
- 新发现:AgenticCache 发现 plan locality,cache-based plan reuse 降低 65% latency
- Agentic RL 的 failure mode 诊断(如 RAGEN-2 template collapse)开始受关注
- L3 Evolver 层级仍是 open problem——现有系统无法自主修正模型;2608-Zeva 给出一个受限的例外,代价是适应发生在可检索的交互记忆里而不是模型参数里(见趋势 27)
- 新发现:2607-GigaWorld1 把 WM-as-evaluator 的成功标准从视觉保真改写为 evaluator–world outcome agreement;2607-BadWAM 揭示 WAM 的 action–imagination 解耦攻击面
- 新发现:digital domain(web/GUI)的 world model 生态成型,收敛于文本语义状态空间而非像素(2411-WebDreamer/2511-DreamGym/2510-UISimulator/2607-SeerGuard)
- 新发现:实时 video WM 的关键转向 control–memory–distillation co-design;但 camera-controllable renderer 与 action-conditioned simulator 必须分开,16 FPS 不等于物理或决策可用(2607-Wonder)
- 新发现:digital WM 出现两条显式 grounding 路线——外部 tutorial ground imagined rollout(2510-RWoM)与 executable object/procedure model(2607-ObjectCentricEnv);前者延缓 compounding error,后者用代码执行保证内部一致性,但都没有解决语义正确性的外部审计
- 新发现:Environment Engineering 把 world model 从单一模型提升为 environment lifecycle 的一个组件,正确性以外的 diversity / complexity / fidelity 仍缺成熟评估(2606-EnvEngineeringSurvey)
- 新发现:生成保真与物理判别在同一模型上可以背离——2607-PhiZero 在 Physics-IQ 生成端第一却在 IntPhys2 Hard 接近随机基线,“视觉像 → 懂物理”的推定被直接反驳
- 新发现:WM 的用法从训练期扩展到推理期——2607-WorldActionPlanner 把 policy 降级为工具、规划全程在想象中完成,1 次想象胜过带 ground-truth reward 的 BoN-8
- 新发现:“被预测的未来该是什么表示”成为 WAM 的显式设计轴——2607-STWAM 在 VAE 未来之外并行预测 DINO 语义未来,2607-N0TWAM 把触觉与视觉一起当生成目标;但两篇的消融同向指向一个反直觉结论:新增的那条预测通路不是主要收益来源
- 新发现:world prediction 进入 RL 的 critic 侧——2607-WCM 让 critic 在预测 return 的同时预测下一帧 latent,drop-in 替换四种 VLA RL 算法的原 critic;λ=0 的 history-ViT 对照把增益与”多看几帧”分开
- 新发现:Levels × Laws 中长期空置的 Social 约束域出现第一篇正面工作——2607-MentalWorldModeling 把 belief/goal/intention 升格为随动作演化的状态变量;但其消融显示移除 physical 通道(−16.5)比移除 mental 通道(−12.1)代价更大
- 新发现:评测侧出现 explicit fulfillment vs. inherent reactivity 的切分——2608-WorldExam 把”指令写明的后果”与”须自行推断的后果”分开报告,得到一次方向反转:action 接口控制更准却让世界毫无反应,language 接口反之;同一批模型的视觉质量层几乎不含区分度(General 79.64–81.04),任务层却铺开 25 分(39.85–65.02)
- 新发现:“world model 只当训练信号、部署期整体丢弃”在四篇独立工作上收敛为 WAM 的默认工程形态(2608-SimWAM 驾驶 / 2608-JEPAWAM latent 空间 / 2608-WorldTokens 表示瓶颈 / 2608-MobileWAM mobile manipulation,加上此前的 2607-STWAM),且三篇的消融从不同方向指向同一耦合拓扑结论:监督应经共享表示塑形 policy,而不是把预测的未来喂给 policy(详见路线 4 分支)
- 新发现:digital WM 出现”内化进 policy 权重”的极端形态(2608-EnvACE)与”学出来的 RSSM 做 25ms 级 pre-execution guard”(2608-DreamGuard);两者与 GUI 侧的 2608-AppDeltaWorld 共享同一未解缺口——彩排/渲染保真度从未被直接测量,状态等价判定缺失
- 新发现:诊断式评测出现第二条切法——2608-WorldSimProbe 沿”动作 → 已实现运动 → 环境响应”的因果链把 rollout 拆成两个可观测条件,得到三条跨模型一致的读数:faithfulness 随控制偏离训练分布单调退化、contact 失败在其审计样本中全部是幻觉出接触而非漏掉接触、VLM 二元 rollout judge 在 OOD control 上判 91.7% 通过而人类只判 42.2%
- 新发现:长时程 visual persistence 的第一约束被重新定位——2608-WorldTrace 指出记忆不是没存下而是读不到(rollout 超出训练 horizon 后 RoPE 的 query–key offset 落到训练分布外),恢复可寻址性无需重训即可在 O(1) cache 预算下拉回 revisit 一致性;同路线的 2607-ABotWorld0 用 bounded KV cache + rolling eviction 换到消费级 GPU 的实时性,代价正是 memory 成为其七个评测维度里相对最弱的一项
- 新发现:显式 3D 表示补上了此前缺的 action conditioning 与 scaling 证据——2606-PointWorld 把 state 与 action 统一为 3D point flow,模型(50M→1B)与数据(5%→100%)两轴都给出 log-linear 的预测误差下降;4D 生成侧则把接口从 RGB 上移到 shared VAE latent(2608-LatentTo4D)
- 新发现:评测出现第三条切法——分布层。2608-PAWBench 不问单条 rollout 像不像,而问同一初始观测与动作下 50 次 rollout 的经验分布对不对:11 个视频系统没有一个同时做到概率质量对齐与宽支撑覆盖,且观测到的偏差(TVD 均值 31.2)约是同样本量 Monte Carlo 噪声(8.33)的四倍
- 新发现:“可执行程序”成为世界表示的独立一支——2608-CodeAsWorld 把场景反解成 MuJoCo 规格再导出精确物理量,2609-ProgrammableWM 把 canonical world state 交给编码 agent 写成程序、把预训练视频模型降级为渲染器(见路线 11)
- 新发现:WAM 的设计空间第一次被当成受控变量逐个测——2609-OpenWAM 用无参数的组装规则把 encoder / backbone / attention mask 拆成可替换模块,得到两个与流行叙事相反的读数:最优训练 mask 在预训练前后改号,16 种”先想象未来再反解动作”的异步去噪配置全部输给同步对角线(最好 92.3 对 93.0)
- 新发现:world model 移到 agentic RL 与科学发现循环的评分侧——2608-WMRL 用冻结 LM 预测 leaderboard 名次替代 sandbox 真跑(GPU-hour 883→286),2609-DreamRSI 把跑完的 discovery tree 冻成 replay simulator 复评候选探索策略,2609-DiscriminativeWM 把 web world model 的训练目标从拟合状态格式改成”能否把候选动作的后果彼此区分开”
- 新发现:L3 Evolver 出现第一个正面读数,而且它不在权重里——2608-Zeva 把已执行动作与其引发的状态变化编码成可检索的因果记忆、注入冻结的 policy,累计成功率在 4 次 attempt 内从 26% 升到 73%,全程无梯度更新
- 新发现:评测器本身成为被诊断的对象——2608-HarnessEvalW 把打分改写成逐 case 路由技能、留证据树与跳过理由的 agent 流程,在同视频同后端对拍中把 Physical pairwise accuracy 从 31.9% 提到 71.7%,但 draw 率同时从 52.2% 塌到 1.8%,按决断子集归一后判对率只从 66.7% 到 73.0%;同一批数据还给出针对世界模型用途微调的代价形状——两个微调模型相对各自底座都是 revisit 涨而 intentional / physical 跌(最大一档 −24.2)
技术路线
1. Pixel-space Video Diffusion WM(future prediction 主脉)
核心思路:直接在 RGB(或其 VAE latent)空间用 diffusion/flow matching 建 , 可以是 text / action / trajectory / camera / goal。backbone 迅速从 U-Net 迁向 DiT/MMDiT。
代表工作与证据:
- 2408-GameNGen(ICLR 2025):fine-tune SD 1.4,20 FPS 实时模拟 DOOM,noise augmentation 解决 auto-regressive drift 成为此后 AR video WM 的标配 trick
- 2405-DIAMOND(NeurIPS 2024 Spotlight):EDM-flavored 像素空间 diffusion WM 在 Atari 100k 拿 mean HNS 1.46,EDM vs DDPM 的 稳定性分析对所有长时序自回归生成都 transferable
- 2501-Cosmos(NVIDIA, 2025-01):20M hour 视频 → 100M clips 的 industrial data curation + causal wavelet tokenizer。物理对齐(Isaac Sim 8 rigid-body scenes)大小模型基本不变,首次给出 “scale 不能 alone 解决 physics” 的 negative evidence
- 2405-Vista / 2405-OccSora:自动驾驶 WM 的 video vs occupancy 两端
- 2406-IRASim(ICCV 2025):Frame-level AdaLN conditioning——把 text-to-video 的 video-level embedding 改为 per-frame action embedding
- 2604-MultiWorld:Multi-agent multi-view video world model,用 MACM + GSE 保证多视角一致性
- 2604-HYWorld2:多模态到 3D 世界的流水线(HY-Pano → WorldNav → WorldStereo → WorldMirror)
- 2603-HybridMemory:动态主体出画再入画的 memory 机制,用 HyDRA 压缩 memory latent
- 2604-WorldR1:RL(Flow-GRPO)对齐 video generation 与 3D 约束,不修改底层架构
- 2505-DreamGen:明确把 video WM 定位为 offline data engine,从单一 pick-and-place teleop 数据 + neural trajectory 解锁 22 个新动词 / 10 个新环境
- 2607-RynnWorldTeleop(DAMO):“数字遥操作”data engine——hand-pose 流实时驱动 40+ FPS action-conditioned WM 合成机器人 egocentric 视频,合成数据可零样本迁移真机;但 headline 质量(FVD 550, 2.8 FPS 双向版)与速度(40 FPS causal 版, FVD 1226)来自两个不同模型,且 Stage 2 仍需 1,800 条真机 MoCap 数据——是窄分布内的数据放大器而非”替代真机”
- 2607-AlayaWorld:LTX-2.3 微调的可实时游玩视频世界(720p/24fps/1s chunk),双记忆(3D cache 几何持久 + 压缩帧历史)+ error bank(训练时注入 rollout 残差 artifact)应对长时程稳定性;零定量评估,处于 teaser 阶段
- 2607-Wonder:以 Pixel-Space Coordinate Field 把 camera trajectory 渲染成 frame-aligned visual evidence,结合 full-fidelity sparse KV retrieval、Sparse Context Forcing 与 few-step autoregressive distillation;作者报告 minute-scale 16 FPS,I2V average/RPE 为 0.8558 / 0.0132 / 0.0784,但未交代 inference GPU/分辨率、无 component ablation,long-term memory 只靠 Figure 9 qualitative revisit。它证明的是 camera-controllable navigable renderer,不是 agent-action simulator
- 2607-ABotWorld0(partial 核查,下列均为 source-verified 行):把”实时”的口径讲清楚的一份部署报告。动作接口是每帧 8 维键盘 multi-hot(每 4 帧打包成 32 维 token,在 patchify 阶段加性注入 Wan2.2 DiT),训练走 teacher forcing → ODE distillation → LongForcing 三段蒸馏,部署侧 LightVAE、低比特 DiT、Fast-RoPE、bounded KV cache 协同,单张 RTX 5090 上 1280×704、最高 16 FPS、按键到首帧可用 1.2 s、峰值显存 ≤19.3 GiB。逐配置的系统消融比总分更有信息量:只换注意力 kernel 仍然 OOM,第一个可跑配置由 LightVAE 给出(9.117 FPS / 20.491 GiB),16 FPS 来自最激进的 MXFP4,而作者声明的质量优先工作点 FP8 是 12.4–13.3 FPS。能力侧没有拿到任何一项第一:WorldRoamBench 七个子维度全部第二或第三,相对差距最大的一项正是 memory(0.5041 对 Genie 3 的 0.6073 与 HappyOyster 的 0.6309),而 rolling eviction 按设计就丢弃窗口外历史、reference-character memory 只覆盖可控角色的外观一致性。边界:该 benchmark 的作者与本文 Benchmark Team 重叠,“与 Genie 3 打平”应按自家评测读;表内 LingBot-World(14B)与 HY-World 1.5(8.3B)的分数只有 5B 模型的一半以下,论文未解释,更可能是配置或协议适配问题;小时级与天级 rollout 只有关键帧条、无量化指标,长程唯一的定量证据是 60 秒 LongForcing 曲线且无数值表;除 LongForcing 外的方法组件无消融,训练语料规模未披露,评测跑在哪个量化配置上也未交代
- 2609-SolarWM:把数据准备到长时程推理的整条链路一次开源。data engine 把 10 个来源的 1,425,694 条 canonical clip 归一成含 metric 相机位姿与内参、caption、质量指标、选择决策与 provenance 的 frame-aligned 契约,876k 条入选、549,101 条被拒样本连同机器可读的拒绝理由一并发布——被拒样本带理由发布,是这条路线上第一次让数据配方的选择本身可被外部复查。模型侧用同一套 fused-PRoPE 相机条件与”bidirectional adaptation → teacher-forced AnyFlow → DMD”三段配方,在 Wan2.2 / LTX-2.5 / MiniMax-H3 上实例化 5B–33B 四条 backbone-native 路线,只用 5 秒序列训练便跑出 4 步采样、16 fps 的 60 分钟不间断 rollout 且无 attention sink。代价是全文零定量评测:Experiments 只有定性图,contribution 里的 “state-of-the-art performance” 与 abstract 的 “real-time interaction” 在正文没有任何数字、baseline 或 ablation 对应
路线内分支:reason-then-render。2607-PhiZero 不在像素或 VAE latent 上直接做时序建模,而是先把视频压成自监督学到的离散”物理语言”(FSQ levels (8,5,5,5,5,5)、25K 词表,4 秒视频 → 256 个符号),由 Qwen3-VL-4B 在符号空间预测未来,再交给 Wan2.2-5B LoRA 扩散解码器渲染。动机是把”预测”与”渲染”解耦,让物理推理发生在低维离散空间。生成端指标支持这一设计:Physics-IQ Verified IQ-Score 41.2 > Cosmos3-Super 39.5 > Wan2.2-14B 32.2,PhyGround Physics 3.01,WorldModelBench Total 8.19。
但判别端没有同步跟上:IntPhys2 Overall 56.34、Hard split 仅 52.38(随机基线 50,V-JEPA 57.42),LikePhys 刚体 29.14 最好而流体 53.15 倒数第三,WS-IoU 27.6 落后。这直接落在路线 6(evaluator)与本表下方 planner 分支的要害上——那两种用法消费的正是判别能力,而不是画面质量。方法层的关键缺口是没有同数据同算力、仅移除中间表示的对照,21.2→41.2 的增益混淆了表示、数据与训练三个变量;离散表示本身是有损压缩(256 符号重建 PSNR 28.9,Wan2.2 VAE 用 44,800 token 达 37.7);其 “zero-shot” 迁移仍需按源域微调 tokenizer,4 秒固定视界靠滑窗自回归外推,无代码发布。
路线内分支:长时程失败先是寻址问题,再才是容量问题。这条路线此前对 revisit 崩坏的处理都落在”存什么、存多少”上——2603-HybridMemory 压缩 memory latent,2607-Wonder 从全量历史 KV 中检索固定大小的 active set,2607-ABotWorld0 直接用 rolling eviction 把窗口外的历史丢掉。2608-WorldTrace 把根因挪到另一个轴:训练时 query 只见过有界的相对 offset,rollout 超出训练 horizon 后 query–key offset 落到训练分布外,快频 RoPE 分量的相位绕过 π 多圈、对 attention score 的贡献退化为噪声——内容还在 KV cache 里,attention 读不到它(附录对 MG2-1.3B 的逐频率量化:训练最大 offset 为 5 时 f≥10 的分量仍是语义载体,offset=30 时最快三个分量相位已超 3π)。与之耦合的第二个失败在内容侧:在已旋转的 RoPE 空间对 key 做平均,不同时间戳的旋转角方向相反而部分抵消,无论内容是什么该频率的信号都被削弱。
两处修法都不改权重。summary slot 的 virtual position 只由 slot rank 决定,因此与绝对 horizon 无关、恒落在训练分布内且各 slot 互异(避开 Block-relative 封顶导致的 slot 坍缩);key 在未旋转的 canonical 空间压缩、读取时单次旋转到该 virtual position。固定压缩方式只换 position 的对照隔离出位置轴的独立贡献:TempSSIM 超 Block-relative +5.9%/+2.8%、超 Centroid-linear +9.5%/+13.8%。两个写入器分工明确——连续时间组平均的 Field 管 coherence(N=48 TempSSIM 0.545 对 sliding window 0.472,Scene Drift 同时最低),冻结 scene-entry 帧 canonical key 的 Landmark 管 episodic recall(ABA loop 上 PAC 0.864 对 0.723;N=256 时 verbatim landmark 保持 0.989,而只做 canonical 压缩的一档跌到 0.610)。开销上 Field 的峰值显存与 sliding window 完全一致,Landmark 恒定多占约 0.6 GB。
其中一个负结果的迁移价值大于主结果:把这套 position 方案单独接到 MemRoPE 的写入器上反而更差(p<0.001),因为写入与读取的 offset 分布不再一致。位置与内容写入必须在同一 offset 分布下共同设计,单独替换任一侧可能有害。边界:主结果在单一 1.3B game world model 上,14B 的 LingBot-World 只有附录级验证且 Field 在其上几乎无增益(Plücker 相机条件已提供 recall 信号),Landmark 在 2× 训练 horizon 无显著增益;LoopBench 由同一团队提出并主要用于验证自家方法,其 PAC 依赖 CLIP 相似度,对”几何一致但外观漂移”的敏感度未测;同一 ABA 配置在不同表里的绝对 PAC 差异很大(N=16 的 sliding window 分别为 0.723 / 0.540 / 0.837),论文未解释口径差异,跨表数字不可混用。Field 对 recall 几乎不帮忙、Landmark 靠 cosine-spike 阈值与 FIFO 逐出,“该记住哪些地方”仍无答案。
2608-AlayaEvoke(partial 核查,下列均为 source-verified 行)把寻址从 RoPE 内部挪到外部存储上:denoiser 只保留最近 19 个 latent frame(约 3.2 s),场景几何另存进一个按相机位姿而非时间位置检索的 world state bank,容量 2,160 像素帧即 90 秒几何。它的责任划分论证可以单独带走——时间上的内容漂移要靠更长的监督窗口,空间上的回访不一致要靠显式存储加几何寻址,两者不是同一问题的两种说法;对应的训练形态是 1 个 GT prefix + 20 个 self-forced chunk 展开到 189 个 latent frame(约 31.4 s),梯度只加在中间段且 chunk 间 detach,监督视界因此与梯度视界解耦。
两个读数限定了它的适用范围。其一,为内容漂移设计的长视界监督目前只在光度稳定性上被证实:长 teacher 让开局亮度稳定在 101%、短 teacher 落到 74%,8 段中 7 段改善(Wilcoxon p=0.016),而 content descriptor 与 sharpness 两项均不显著。其二,显式几何存储买到一致性的同时付出可控性——回访在 retention ≥ 离开时长时高 2.3–3.2 dB(21 组中 20 组符合预测),但平台只到 15.4–17.8 dB,是”可辨认”而非像素级忠实;中途改写文字条件时,未锚定内容 67% 被实现(上限 83%),而需要覆盖 bank 已锚定几何的改动只有 4%(上限 17%)。写进显式记忆的东西难以再被语言改写,这与 WorldTrace 的 verbatim landmark 保持 0.989 是同一枚硬币的两面:寻址修复得越硬,事后干预的余地越小。边界:WBench navi Average 80.8 的第一只领先 HiDream-O1-World 0.1,且为作者自评、非榜单提交、非 step-matched,其 Navigation 78.63 与 Perspective 69.74 均非最优;两个 VBench 结果都偏离官方协议;65.5 分钟长会话的 cosine 0.523 平台按作者自述是 n=1 的稳定性断言而非保真度断言。
第三个候选病灶在编码器一侧。2606-GRWM(CVPR 2026,partial 核查)用一个 oracle 对照把问题从 dynamics 挪开:同架构下让 encoder 直接吃 ground-truth agent pose,长程误差近零,而 VAE 编码的同一模型误差迅速累积——在 deterministic、低维 state 可获取的受控设定里,长程 fidelity 的瓶颈成分是表示而不是转移模型。对策是给带 causal Transformer 时序聚合的 VAE 加两项作用在单位超球面上的正则(同轨迹帧对的 temporal slowness + 跨轨迹的 uniformity),latent probing MSE 从 0.082/0.106/0.137 降到 0.031/0.058/0.081,63 步 frame-wise MSE 在 3 数据集 × 3 dynamics backbone 的 9 组组合上全胜。这条结论目前买不到下游:全文与附录没有任何 planning / control / task-success 评测,一万帧 rollout 只有可视化且用随机采样动作序列;且 GRWM 相对 baseline 同时改了 encoder 架构与两项 loss,缺”保留时序聚合、只去掉两项正则”的对照,“latent 几何是关键变量”的因果归属因此不干净。三个病灶(读不到、存不下、编码得不利于外推)互不排斥,但至今没有一篇把它们放进同一套对照里定量分摊。
路线内分支:动作怎样进入视频模型,本身是一条设计轴。这条路线的动作接口长期由 backbone 的便利性决定——IRASim 的 per-frame AdaLN、2607-GigaWorld1 的 channel-concat pose map、2607-ABotWorld0 的 8 键 multi-hot,够用即可。四篇近期工作把接口本身当成被研究的对象,各自留下一个可迁移的判据。
| 工作 | 动作表示 | 接口层面的判据 |
|---|---|---|
| 2608-Hydra0 | 图像平面上的稀疏点轨迹(N 条 + 可见位 + H+1 时间戳) | 同一接口可由纯视频反解(AllTracker 网格 + SAM 3 掩码分组),因而能吃 DROID / EgoDex 这类无 URDF 无标定的语料 |
| 2608-DreamXPhi | 每臂 SE(3) 的 PRoPE,按固定 attention head 组注入 | 夹爪开合不是 SE(3) 元素,只能降格成每臂加性 bias——接口的代数结构决定哪些控制量根本进不来 |
| 2609-H3World | 8 键状态查表翻成 character+camera 复合英文指令,与每个 latent 区间一一绑定 | 不新增 action module 也能拿到时序绑定;但方向跟随本身不是适配买来的 |
| 2608-CAER | 不改接口,改监督的空间分配:在线比较真实 action 与 null action 的预测差,把 coefficient mass 重新分配到因果敏感 token | 预算守恒、无需外部标注;代价是聚合分与分项可以反号 |
Hydra-0 的对照说明接口收益极易被高估:Average gripper EPE 3.29 / object EPE 5.27 对 Cosmos 2.5 基线的 34.28 / 13.23(90.40% / 60.16%)同时换掉了表示、backbone 与蒸馏三样东西,固定 backbone 后的受控数字是 34.28→13.80(59.7%)与 13.23→6.27(52.6%)。同一张表还暴露 gripper EPE 这个指标自身的问题——零样本的 ATI 4.62 与 Wan-Move 4.67 已经比微调过的基线低一个数量级,它主要测的是条件被复制得准不准;object EPE(零样本 23.19 / 21.53)才是有信息量的那一列。速度侧的口径同样要读全:双向 teacher 20.92 s、AR teacher 12.48 s、few-step student 1.31 s(61.98 FPS,H100 / bf16 / 81 帧 480×832),但这是不含 VAE 解码、关掉 guidance 的纯生成计时,而其 world action model 用的是 50 步 teacher。
H3-World 与 CAER 各给一条方法层纪律。H3-World 的 constant-action 对照是决定性的:冻结底座配全局 prompt 的 directional separation 已经 301.8,适配后 300.5 几乎不变——“加了动作接口就涨”的读法必须先扣掉底座本身的指令跟随能力,真正被买到的是切换时刻的时序绑定(切换调度下 +52.7 / −106.0,对照组 0.0 / −17.3)。它以 0.199% 可训参数、7,872 段 clip 完成适配,但全文除 Farneback 光流外没有任何定量指标,“优于专用 action module” 只有一张单例定性图。CAER 的读数是聚合分掩盖分项反号:LIBERO EWMScore 57.66→61.79、RoboTwin 62.35→63.13,而 camera 设定下 Trajectory Accuracy 从 0.6211 掉到 0.5474、Instruction Following 从 0.6929 掉到 0.6860——把监督挪向因果敏感 token,会同时挪走跟住轨迹所需的那部分。这与 Takeaway 16 指向同一处:动作是否被跟住必须单列,不能靠总分推断。
实际效果与优点:视觉保真度天花板高(GameNGen 人类辨真伪仅 58–60%);天然吸收 internet video prior;和成熟 video diffusion 工程栈复用。
缺点与未解 gap:
- Action-following 不可靠:World-VLA-Loop 展示 Cosmos-Predict 2 在错 action 下仍 hallucinate 成功——policy 在此类 WM 上做 RL 会 reward-hack。2608-WorldSimProbe 把这条从个案变成六模型三平台上的系统读数:cross-task replay 中 fidelity 随 receiver–donor 运动失配增大而下降(平均 Spearman ρ=−0.433,RoboTwin),且即便轨迹仍是 task-directed,只要执行风格换成 early-checkpoint policy 或人类遥操作者,六个模型全部比 late-policy 低 10.8–16.1 分;action-injection 与 unified action–video 两类架构都横跨高低名次,架构本身不解释 faithfulness(详见路线 10)
- 控制被执行但世界不回应(与上一条相互独立的失效面):2608-WorldExam 把”指令写明的后果”与”须自行推断的后果”分开评后出现方向反转——action 接口在 Subject Control 上领先(55.47 对 language 最好的 37.28),Terrain / Object Interaction 却只有 27.49 / 33.75 对 64.39 / 75.96。动作被照做了,地形、被接触物体与附近 agent 却纹丝不动(详见路线 10)
- 长时序 drift:GameNGen 3 秒 context、DIAMOND memory bottleneck、World-VLA-Loop 主动放弃 LIBERO-Long——>200 帧后视觉/几何普遍漂移;Wonder 用固定 active set 检索 full-fidelity historical KV 把 active attention cost 与 history length 解耦,但 total KV storage 仍增长、revisit 无定量 metric,尚不能算解决。其中静态场景 revisit 这一部分现在有了机制解释与 training-free 的对策(2608-WorldTrace:offset 越界导致的不可寻址,恢复后 O(1) 预算下 ABA loop PAC 0.864 对 0.723),但动态主体的出画-再入画(2603-HybridMemory 测的那类)与”该记住哪些地方”的写入策略都不在其覆盖内
- 物理对齐不随 scale 解决(Cosmos Tab. 20):需 data curation 或 hybrid physics inductive bias
- 推理成本高:典型 14B DiT naive 5.7 s/chunk,即使 38× 工程栈加速后仍需 2×GB200 才能 7 Hz 闭环。消费级硬件的可行区间由 2607-ABotWorld0 标出:5B + 三段蒸馏 + 全栈量化在单张 RTX 5090 上 12.4–15.8 FPS,但 WorldRoamBench 七项无一第一,速度换质量的那条曲线本身没有被测(评测跑在哪个量化配置上未交代)
- 单条 rollout 合理不等于结局分布正确:2608-PAWBench 在 50 个物理场景上把同一初始观测与动作重复 50 次转成经验分布后,11 个系统没有一个同时做到概率质量对齐与宽支撑覆盖,最好的 Coverage(LTX-2.3 71.7%)其 Calibration 通过率只有 24.0%;且这不是采样噪声——观测 TVD 均值 31.2 对同样本量 Monte Carlo 的 8.33,每个生成器都超出自己的 99 分位(详见路线 10c)
- 长时程可玩性的发布普遍不带定量验收:2607-AlayaWorld 零定量评估,2609-SolarWM 的 Experiments 只有定性图却在 contribution 写 state-of-the-art,2609-H3World 除光流外无任何指标,2606-GRWM 的一万帧 rollout 是可视化用途,2609-ProgrammableWM 的 897 帧长序列同样只作定性展示。共同原因是这类系统的验收协议尚无公认口径——多长算长、revisit 怎么判、交互性怎么量都没有定义,于是发布方以展示替代评分
2. Latent-space / JEPA-style WM(implicit representation)
核心思路:不重建像素,只在 representation 空间做 mask-denoising / next-state prediction,让 predictor 学 “latent dynamics”,下游用 CEM / MPC 做 planning。
代表工作:
- V-JEPA 2(FAIR, 2025-06):1M+ 小时视频 mask-denoising 预训练 → 冻结 + 62 小时 unlabeled Droid 视频训 action-conditioned predictor → CEM 在 latent 上 receding-horizon planning。Franka pick-and-place zero-shot 65–80% vs Octo 0–15%;V-JEPA 2-AC 16 s/action vs Cosmos 4 min/action 且 success rate 反超
- RWM(ETH, NeurIPS 2025 Workshop Outstanding Paper):GRU + 多步 autoregressive 训练学 legged robot dynamics;architecture 不是关键,autoregressive training 才是。在 ANYmal D / Unitree G1 上 zero-shot 硬件部署,reward 打平 250M-step model-free PPO 但只用 6M transitions
- 2606-Orca(BAAI):Next-State-Prediction 统一 world latent——unconscious(相邻帧 dense transition)+ conscious(event-conditioned)双路监督,冻结 backbone 后由 language/image/action decoder 读出。frozen-readout probe 是”latent 是否真承载 state transition”的可反驳检验;4B 在 OOD readout 超同量级专用 baseline,但 real-robot binary success 仅 6%
- 2603-Memoir(TPAMI 2026):contrastive RSSM world model 的 imagination 只作 retrieval query 而非 planning——预测不准时只是检索差一点,不会执行错误动作。IR2R +5.4 SPL + 8.3× 训练加速;但 imagination-based 检索相对朴素 state-based 仅 +0.61 SPL,主要收益来自选择性检索框架本身
- 2607-QQWorld(西安交大):把 latent WM 的分布正则从 Epps–Pulley 特征函数检验换成 quantile–quantile 匹配。可迁移的判据藏在两条 proposition 的对比里——EP 的恢复力 在 达峰后超指数衰减,偏离越远梯度越小,正好放过最该被拉回的离群点;QQ 的梯度 对偏差线性。一个善于”度量”分布差异的统计量未必是好的”训练目标”,其梯度场必须处处有信息。planning 平均 79.75→85.08(4 环境 × 6 seed),tail rate 0.315→0.123,EP 统计量 119.909→82.294。边界:只在单一 LeWM backbone 上验证,Reacher +2.66 与 OGBench +3.00 落在标准差内,相对 DINO-WM 仅 +0.33pp,三条 proposition 原文未给证明,无代码
- 2608-DALeWM(partial 核查,下列均为 source-verified 行):把评价从”latent 编码了什么”(information sufficiency)切开为”planner 实际消费的那个 Euclidean goal distance 能不能把候选动作序列按真实任务进展排序”(decision-metric alignment),并给出两个可测诊断。据此加的两个辅助头(inverse dynamics + demonstration-conditioned goal-action,α=β=0.1)只在训练期存在、评测时丢弃,推理期 MPC 与 planning 计算量与 baseline 完全相同:PushT 一 epoch matched budget 下 online success 从 49.3±12.2% 升到 92.7±1.2%,而四个非坍缩变体的 linear probe R² 相差不超过 0.03——信息充分性与决策可用性确实是两个量。最有信息量的是两个诊断都解释不了这次提升:inverse-only 的 Plan-Real Spearman 最高(+0.420)却只有 64.0% success;elite 阶段的 Spearman 对全部五个变体都在零附近(+0.036 / −0.102 / −0.089 / −0.010 / −0.011),Appendix E 的 elite 邻域 Pearson 也一律只有 +0.050~+0.092——在 planner 真正做取舍的那个邻域里 latent cost 与真实 cost 几乎无关,而 success 仍到 92.7%。边界:每个配置只训练一次、±std 只覆盖评测变异;Table 5 的对照是已发表数字而非同预算复跑,DA-LeWM 仅在 PushT 与 Reacher 第一;β 由 0.1 调到 0.3 时 Reacher 回退到 78.0%、低于 LeWM 的 82.0%;Table 1 里 LeWM 一 epoch 的 TwoRoom 98.0 还高于 Table 5 中 DA-LeWM 的 10-epoch 96.0
- 2609-SparseResidualWM:per-object change gate + residual delta head 替代整体状态预测,参数少 8.6–11.1× 而 overall L2 做到 dense MLP 的 1/2.5–1/4.6。但作者自己按 changed / unchanged 拆开误差后发现优势几乎全部来自”不去污染静止物体”:真正移动的物体上 L2 与 no-op 复制基线持平(N=8 为 0.466 对 0.470),horizon-20 rollout 整体劣于 no-op,CEM planning 的 0.23±0.06 也不显著优于 random 的 0.15,于是论文在正文里主动把结论收缩为”一个不注入误差的 change detector,而非更准的动力学模型”。它的价值不在方法而在验收纪律——no-op 复制基线、随机动作下限、按变化/未变化分层的误差拆解,这三关本 survey 里绝大多数预测误差型结论都没有过
- 2512-NavForesee(CVPR 2026,AMAP):单个 Qwen2.5-VL-3B 同时做显式 hierarchical language planning 与隐式 dual-horizon 预测(短期 k 步动态 + 长期自适应至下一 milestone 的高层特征),共享表示、交错训练,预测特征经 MLP 出连续 waypoint。R2R-CE Val-Unseen NE 3.94 / OSR 78.4 / SR 66.2,但 SPL 59.7 低于 CorrectNav 的 62.3——预测帮到了”能不能到”,没帮到”绕不绕路”。Table 2 里有一行比主结果更重要:三模块全关的 SR 52.6 高于”只关 planning、两个预测视界都开”的 48.8,即缺少语言与目标条件时,预测信号是净负资产,而论文未讨论这一行
优点:计算高效(V-JEPA 2 对 Cosmos 的 15× 推理优势);数据效率极高;与 MPC/CEM 天然兼容;辅助预测目标可以只在训练期存在,不加推理开销(2608-DALeWM)。
缺点:像素生成能力弱;Goal specification 受限;Cross-embodiment 验证薄;Latent 不可解释。另有一条此前没被单独列出的:latent 的诊断指标与 planning 成败之间没有建立起可靠映射——probe R² 相差 ≤0.03 而 success 跨 43 pp(2608-DALeWM),latent probing MSE 降一半也没有任何下游控制评测跟进(2606-GRWM),而预测精度本身可能连 no-op 基线都赢不了(2609-SparseResidualWM)。这条路线的验收目前普遍停在代理指标上。
3. 3D / 4D Generative WM(空间侧)
核心思路:把 WM 绑到显式 3D 表示(occupancy grid、3DGS、point cloud)上,在 4D 体素/pointcloud 空间做未来生成或直接回归。这条路线内部已分成两支:一支做场景合成(生成一个可漫游的动态 3D 世界,无动作接口),一支做 action-conditioned 3D dynamics(在给定机器人动作下预测全场景几何如何变化)。
代表工作:
- OccSora:nuScenes 上 DiT + 4D VQVAE 生成 16 s 驾驶 occupancy video,但小物体(VRU)重建崩塌
- HY-World 2.0(Tencent Hunyuan):四阶段 pipeline panorama → WorldNav → WorldStereo → WorldMirror → 3DGS,端到端 712 s 生成可交互 navigable 3D 场景。核心 insight 是 keyframe-latent VDM
- Generative World Renderer:ReShade + RenderDoc 从 AAA 游戏截取 G-buffer,fine-tune Cosmos-DiffusionRenderer
- 2604-SpatialEvo (🔥 Rating 3):3D 空间推理的答案可以从点云和 camera pose 确定性计算(DGE),不需要 model voting;w/o Physical Grounding → VSI-Bench 从 46.1 暴跌到 18.8
- 2607-RynnWorld4D(DAMO):投影式 4D = 同步预测 RGB+Depth+Flow,三分支 DiT + Joint Cross-Modal Attention,靠相机模型隐式承载几何、绕开显式 3D 表示;蒸馏 inverse-dynamics policy 在 6 个真机任务赢 5。但 RGB imaging quality 反而低于纯 2D Wan-2.1——几何优势来自显式监督 depth 分支而非表征范式胜利,且全链路建立在伪标注(Depth Anything 3 / DPFlow)上
- 2606-PointWorld(Stanford / NVIDIA, CVPR 2026):把 state 与 action 统一进同一个 3D 模态——state 是 RGB-D 反投影出的 full-scene point cloud,action 是机器人自身几何按 URDF 正向运动学推演出的 dense 3D point flow(只采样 gripper 表面约 300–500 点),world modeling 于是变成”在 robot point 扰动下预测全场景逐点位移”。这个表示选择一次处理三件事:action conditioning 不必往视频里塞 token、动作表示不绑定具体 joint 空间因而跨 embodiment、接触即使发生在遮挡区域也能表达(想象出的 robot flow 完整可见)。PTv3 backbone + 冻结 DINOv3 特征,chunk H=10、每步 0.1 s、单次前向约 0.12 s,可直接驱动 MPPI 做 MPC。DROID 测试集 ℓ2 mover 误差 PTv3-1B 0.0312 对 GBND 0.0390,参数量差 957 倍而内存与延迟只温和增长;模型 50M→1B 与数据 5%→100% 两轴在 log 空间都近似线性下降。真机 Franka 零样本(无 demo、无 post-training、单张 in-the-wild RGB-D)成功率 Drawer 90% / Scarf 80% / Tissue Box 70% / Duster 60% / Broom 60% / Pillow 40% / Microwave 30% / Book 20%。约 2M 轨迹 / 500 小时训练数据里,真实部分靠一条无标注管线(立体深度 → 相机外参优化 → point tracking 后 lift 到 3D)从 DROID 恢复出 >60%(近 200 小时)可靠 3D point flow。边界:主指标是一秒 horizon 的逐点 ℓ2,作者自承绝对误差的小差异可能对应显著不同的 rollout 保真度,ℓ2 与任务成功率的映射未量化,模型层的 scaling 结论不可直接读作下游成功率同步 scaling;真机每类任务试验少、方差极大,task point 与目标位置仍由人或 VLM 指定;sim↔real 零样本明显退化(D→B 0.1460),需 finetune(1/20 迭代即超 from-scratch specialist);依赖精确 URDF/FK 与 RGB-D 深度质量
- 2608-LatentTo4D(ReLER, ZJU):把 4D 生成的接口从 RGB 像素上移到 shared VAE latent——取 video DiT 的最终去噪 latent 而不解码成 RGB,经固定 trilinear resampling + 学到的 3D conv 对齐到由 4RC 初始化的 4D decoder token grid,再由 frame-wise 与 global spatiotemporal attention 交替精炼,直接输出 per-frame camera 与世界系几何。只训 alignment module、rank-16 LoRA 与 prediction heads(final stage 用 1,143 个 clip),单一 checkpoint 免调服务共享同一 frozen Wan VAE 的三个 DiT。相对固定同一 latent 的 Wan+4RC 级联,Text4D-200 DINO-F1 +2.88–3.45、I4D-200 +5.81,四维度 human preference 59.2–72.1% 且八个 95% bootstrap 区间下界全部 >50%。作者自陈的边界很硬:证据只在单一 VAE family 内,projection-based 指标不建立生成场景的 metric accuracy;模型无动作接口,仍是场景生成器
优点:显式 3D 可验证几何;直接对接 CG 渲染 / 物理引擎;2606-PointWorld 表明该表示在模型与数据两轴上都有可预测的回报,且预测本身可以跑到实时。
缺点:场景合成一支的 temporal dynamics / action 缺失依旧(HY-World / OccSora 一代本质是 scene generator,2608-LatentTo4D 也无动作接口);2607-RynnWorld4D 的投影式 4D + policy 蒸馏与 2606-PointWorld 的 point-flow 回归各自补上 dynamics 与 action,代价分别是依赖伪标注几何与依赖 RGB-D 加精确 URDF;数据稀缺;精度-压缩权衡。两支共有的验收缺口是几何/流误差与下游任务成功率之间的映射从未被量化。
4. Unified Video-Action / VLA+WM Joint Models(即 World Action Model, WAM)
核心思路:把 VLA(policy)、forward dynamics(WM)、inverse dynamics、video generation 统一进一个模型,通过 timestep / mask 切换。这条路线在 2026 被正式命名为 World Action Model(WAM)(DreamZero 定义),核心 claim 是 “world models are implicit policies”——video generation 天然具备的时空动态理解可直接转化为 motor control;WAM 不是 VLA 的替代而是演进,差异化优势在于能自然利用海量 action-free video 数据(UWM cotraining / DreamGen neural trajectories / Motus optical-flow latent action 各自验证了这一点),DreamZero unseen tasks 上比最优 VLA 高 2 倍以上的泛化正来自 world modeling。
代表工作:
- UWM(RSS 2025, UW & TRI):“diffusion timestep ≡ soft mask”——给 action 和 future obs 独立采样 timestep,推理时切换 policy / forward dynamics / inverse dynamics / video prediction 四个条件分布。DROID 2K 预训练 + 5 个 Franka 任务全面超 DP/PAD/GR1
- Motus(Tsinghua, 2025-12):Mixture-of-Transformers + Tri-modal Joint Attention + UniDiffuser-style scheduler,5-mode 真正跑通。RoboTwin 2.0 randomized +43% over π0.5
- DreamZero(NVIDIA GEAR, 2026-02):14B World Action Model 从 Wan2.1-I2V-14B 初始化,joint 预测 video + action;38× 工程加速 + DreamZero-Flash 做到 7 Hz 闭环。AgiBot G1 unseen-env+unseen-object 62.2% vs best pretrained VLA 27.4%(>2×)
- GenieReasoner(AgiBot, 2025-12):FACT (Flow-matching Action Tokenizer)——VQ-encoder 把动作压成离散 code,flow-matching decoder 重建高保真连续轨迹
- 2604-M2VLA:Mixture of Layers + Meta Skill Module,保留 VLM 泛化
- 2604-CFVLA:Coarse-to-fine action generation,83.0% real-robot success,-75.4% latency
- 2607-FlowWAM(CASIA 等):HSV 编码 optical flow 作统一动作表示——同时满足 video-native、稠密跨帧运动编码、可逆解码三性质;ablation 证明关键在”把 flow 映射进预训练 RGB 空间”(HSV vs raw (u,v) 差 17.5pt);同一表示双向服务 policy mode 与 world-model mode,WorldArena Trajectory Accuracy 64.26 全场最佳
- 2607-ABotM05(AMAP):mobility + manipulation 统一 WAM,frame-level latent action 弥合粗粒度 video chunk 与控制频率的时间粒度错配(RoboTwin 87.60%→94.00%);Dream Forcing 让 inverse dynamics 基于 self-dreamed video 而非 GT future 训练,直接缩小 train-test rollout gap;Composite-Unseen 仅 7.9%——长程组合泛化未解决
- 2607-BadWAM(NUS):WAM 的新攻击面——black-box 有界视觉扰动即可让 action 与 imagined future 解耦(LIBERO 96.5%→43.1%),imagination-preserving 变体在诱导错误 action 的同时保持想象接近 clean,简单 detector 召回仅 13–21%
- 2609-OpenWAM(partial 核查,下列均为 source-verified 行):把 WAM 拆成 frozen visual encoder E、stream backbone S(world / action / 可选 VLM)与 visibility attention mask M 三类可替换模块,由一条不含参数的组装规则
C(E,S,M)装出六个架构变体,配统一 trainer、policy server 与评测协议。这是目前最可操作的一套 WAM 分类轴,也让 backbone 规模、latent 空间、信息流方向、去噪时序、数据配方第一次能逐个当受控变量测(读数见下方分支) - 2608-ZimaBlue:把无 action label 的第一视角视频当作主 scaling 轴——12 万小时人类与机器人视频做 causal video pre-training,再用 6K 小时跨形态轨迹经统一 100 维 state-action 接口接到可执行控制。同一台 7-DoF Franka 的 12 个 held-out 任务上,成功率从只做 DROID post-training 的 36.1% 升到 77.8%;Slow(5B)-Fast(0.5B) 异步双系统(Fast 消费 Slow 第 12 层的 K/V)把闭环延迟压到 33 ms
- 2608-ZeroWAM:把 zero-shot cross-task manipulation 重述为 in-context 任务规约——human video 当任务说明,causal video-action model 按视频提示自回归预测未来 robot video 与可执行 action;HumanGen pipeline 把 robot 轨迹自动转成语义匹配的 human video(74.2K 对 / 8.6K 任务),in-context future chunk prediction 辅助目标抑制”只靠 robot history 外推”的捷径。RoboTwin 2.0 七个 unseen 任务平均 46.95%,比 LingBot-VA 高 29.50 pp——但其中约 22 pp 来自 task-balanced 重采样本身(见下方分支)
- 2608-GameWAM:并行 Video/Action DiT 以 flow matching + block-causal conditioning 联合生成未来观测与可执行键鼠轨迹,per-timestep mode router 分开 gameplay 与 GUI 两套动作分布,block-cycle 控制(预测 P 步、只执行 E<P 步)加层级 cross-cycle memory 支撑长时程交互;MCU 800+ Minecraft 任务上 ASR All 46.6 对 Game-TARS 42.5。它的消融是”视频生成监督对 policy 有实质贡献”的少见正面定量证据:去掉 future-video 监督后 MCU Mini 平均从 50.7 掉到 35.7,mode routing 相对统一动作分布值 +12.4 pt
- 2608-Zeva(partial 核查):把部署期适应从参数空间移到 context 空间——已执行 action 与它引发的 state change 被编码成 causal interaction signal,存入双时间尺度记忆(attempt 内滑窗 + 跨 attempt 合并),检索后作为 causal prompt 注入冻结的 policy(Cosmos3 rectified-flow head)。真机 ChemLab-Evo atomic 83.3 / short-sequence 70.0,仿真 RoboCasa365-Atomic5 76.8 对 Fast-WAM 72.4。核心证据不是主表而是两条对照:累计成功率 4 次 attempt 内 26%→73% 且全程无梯度更新;跨任务替换时最近邻 signal 几乎无损(100%→95%、80% 保持)而随机替换跌到 55% / 45%,说明 signal 空间按物理效应等价类而非任务表面特征组织。边界:Zeva 用 Cosmos3 底座而对照里是 Cosmos3-Nano,主表领先中 backbone 差异占多少无法判断,可靠的机制证据是去记忆的内部消融(去 PIM 降 10–20 点、去 BIT 降 15–30 点);真机每任务 20 episodes、evolve 曲线只到 4 次 attempt,长期部署下的记忆膨胀与错误因果污染未测
路线内分支:被预测的未来该是什么表示。WAM 的默认答案一直是”未来 RGB 或其 VAE latent”,2026-07 出现两篇从不同方向撬动这个默认值的工作——一篇加语义通道,一篇加触觉通道——而它们的消融给出了同向的负信号。
- 2607-STWAM(partial 核查):在 VAE 未来之外并行预测冻结 DINOv3 的语义未来(Dual-Space Future Experts,三分支 MoT 联合 flow matching),并用 Qwen3-VL 抽取的当前视觉-语言语义作 query,从 4 帧 DINO history 检索 intent token 注入 action expert(CAIR)。结构化 cross-branch mask 让 action token 读不到任何 future 流,因此推理时两条 future 分支可整体切掉,代价只有 1.24× 延迟。LIBERO 98.7 / RoboTwin 2.0 92.77 都在饱和区,真正的落点是零样本 LIBERO-Plus 72.8 对 Fast-WAM 51.5、真机视觉偏移 61.5 对 25.8。两个负结果比主结果更有信息量:只用 DINO 未来在 LIBERO-Plus 掉到 39.7,低于纯 VAE 的 51.5——语义表示丢掉了动作需要的细粒度动力学,两者互补而非可换;无锚点的 DINO history 检索只有 56.5,低于完全不用 intent 条件的 66.4。边界:论文用来定义问题的机制断言(“pixel-generative 未来监督把 action-relevant transition 与 task-irrelevant 视觉内容纠缠”)在笔记 Evidence Ledger 中状态为
unsupported——原文措辞 hedged 且无任何 entanglement 度量,本 survey 只引用其消融数字与负结果,不引用该机制;LIBERO-Plus 的 baseline 数字引自第三方研究,LIBERO / RoboTwin 表未交代 baseline 来源,全文无参数量,唯一能确认同示教同流程的干净对照是真机那组;评测的偏移全部是外观级(背景/光照/视角/传感器噪声),而 DINOv3 恰好是对该类扰动不变的表示 - 2607-N0TWAM(NeoteAI / Fudan TEAI):把 touch 放进被预测的未来而不是当输入或外挂——video / tactile / action 三个 expert 只共享一层 self-attention,frame-id causal mask 组成 predict-then-act cascade;触觉走双通路,latent 空间里以残差形式预测未来触觉,force 空间里由 NeoForce encoder 经零初始化 cross-attention 观测当前触觉。UniVTAC 84.5 对 InternVLA-A1 67.1、NeoSim 49.4 对 π0.5 45.8、真机 46.3 对 30.0。消融削弱了它自己的新颖性叙事:预训练规模是 UniVTAC 上最大的单一因素(84.5→65.4),大于任一触觉通路;两个 benchmark 上去掉反应式的 observed 通路(即既有 tactile policy 的做法)都比去掉前瞻式的 predicted 通路(本文的新颖处)掉得更多——70.5 vs 71.8、29.6 vs 41.1。边界:全文没有”去掉 future-vision 预测”的消融,也没有”两条触觉通路同时关闭”的联合对照,因此 predict-then-act 相对直接回归动作的增量在本文内部无 matched 对照;tactile punctuation 的 staging 机制本身无消融;real-time 主张无任何 ms / Hz / FLOPs 数字;三套件中只有 UniVTAC 是第三方公开 benchmark,NeoData / NeoSim / NeoReal / NeoForce 全部出自同一份公司网页报告,规模数字的一手出处不可独立核查;真机每任务仅 20 trials,论文自述二项标准误最高约 ±11%,且逐任务存在方向反转(NeoSim Cup Handover 全模型 14 而 w/o predicted 65)
这条分支目前的共同信号是:两篇都在扩展”未来”的表示,两篇的消融却都显示新增的那条预测通路不是主要收益来源——ST-WAM 的语义未来必须与 VAE 未来并存才有用、单独使用反而更差,N0-TWAM 的预测触觉输给反应式的观测触觉。这不推翻 “world models are implicit policies”,但它给”预测更多模态/更多表示的未来 → 更好的动作”这条推论加了边界条件。库内暂无独立复现,两条均为单篇证据。
路线内分支:训练期消费、部署期丢弃(world model 作纯训练信号)。ST-WAM 靠 attention mask 在推理时切掉两条 future 分支还只是这一形态的单点;四篇独立工作把它推成 WAM 的一种默认工程选择——训练时联合建模未来,部署时把整个 world-model 分支删除、只留一个自含 policy:
- 2608-SimWAM(驾驶域):Wan2.2-5B video expert 与轻量 action DiT 经共享 attention 接口做 joint flow matching,isolated mask 让未来帧 token 与 action token 互不可见,训练后丢弃 video 分支;NAVSIM navtest 91.5 PDMS,超 imagine-then-act 的 DriveWAM(90.1)/ DriveLaW(89.1)。它的 mask ablation 是这条分支最直接的机制证据:让 action 显式 attend 未来帧不涨点(isolated 90.3 ≈ bidirectional 90.2 ≈ action→video 90.1),即 video 先验的收益完全经由共享观测表征传递,推理时的”想象”是可省的开销。边界:0.2 的差距量级在噪声内,结论的准确读法是”可丢弃性零代价”而非 isolated 更优;RL 直接优化 PDM reward 且评测同为 PDMS,+1.2 的 RL 增益无独立指标交叉验证;全部主结果限单前视 + NAVSIM 闭式评测。
- 2608-JEPAWAM:在 frozen V-JEPA 2.1 表示空间做 latent WAM——把当前帧与未来帧沿时间维 stack 联合编码为 joint current–future target(借 tubelet=2 保持 24×24 patch 对应),shared predictor(Qwen2.5-0.5B)同时做 transition prediction 与 flow-matching action 生成,部署时移除 target branch 与 prediction head。0.5B、无 robot-policy pretraining 在 LIBERO-Plus 达 79.2%(其对比中无 pretraining 组最好),同一监督作辅助 loss 嫁接 π0.5 后 84.5→86.3。其 Table 4 的 Full-hidden 对照(把预测的未来表示直接喂 action expert,掉 6.1 个点到 73.1)与 π0.5 transfer 的隔离设计(action token 被 mask、不能 attend future tokens,增益只能来自 backbone 参数被塑形)共同给出与 SimWAM 同构的结论。边界:增益集中在 Camera 扰动列,Language 扰动 68.2 显著低于 ResVLA/RoVLA;RoboTwin 强 domain randomization 下辅助监督几乎失效(37.2→37.5);code 未发布、affiliation 为匿名化残留、基线为同期工作可比性未核对。
- 2608-WorldTokens:把耦合拓扑本身做成贡献——VLM 特征经 Perceiver 式 World Adapter 压成 256 个 world tokens,同时作 future-video denoiser 的条件与 action expert 的唯一 visual-language context(排他路由),部署时移除整个 video 分支、只余约 10 ms adapter 开销(61.85 ms/chunk,π0.5 的 1.1× 内)。其 VLM bypass ablation(94.1 vs full 97.0)回答了”为什么加辅助 video loss 常常不 work”:action expert 能绕开被监督的表示时,video 目标与 action 目标竞争而非塑形;Canny 首帧反捷径的负结果同样有信息量——RGB anchor 让 denoiser 走外观捷径,91.5 低于完全不做 world modeling 的 95.0,辅助任务设计不当是净伤害。边界:“best reported on SIMPLER” 仅相对其表内 baseline;LIBERO 上并非最优(Cosmos Policy 98.5 / DiT4DiT 98.6 更高);无代码、K=256 与 λ_w=5 无 sweep。
- 2608-MobileWAM(详见上方 Chain-of-Foresight 相关讨论):CoF 串行未来链与 video 分支同样只在训练期存在,经四个 backbone tap 层的梯度把动力学压进当前观测表示,推理时 backbone 退化为可缓存的 current-frame encoder(938 ms 对 Motus 4950 / LingBot-VA 8126 ms)。其 Table 3 补上并行对串行的直接对照(并行未来监督 +2.1,MLP 串行 −3.9,transformer 串行 +8.0)——辅助头与主干的接口形状(哪些层、多宽的瓶颈)比监督量级更决定成败。
四篇与 ST-WAM 合起来,这条分支的共同结论可以写得比”部署省钱”更强:world-model 监督的正确耦合方式是经共享表示塑形 policy,而把预测的未来作为 policy 的输入要么无益(SimWAM mask ablation)、要么有害(JEPA-WAM Full-hidden −6.1)、要么依赖排他约束才不打架(WorldTokens bypass)。三组消融来自三个互不相识的团队、三种不同的架构接口。它同时把路线 1 的推理成本缺点(14B DiT 秒级)在这一子族内直接消解——代价是放弃推理期的 rollout / 想象能力,因此与 WM-as-Planner(推理期消费)构成光谱的两端。未决问题:该结论目前全部来自 manipulation / 驾驶的短横幅任务,在真正需要 multi-step lookahead 的长程任务上”丢弃想象”是否仍然无损,无人测过;四篇均无独立复现。
这条结论的前半截已被一个独立反例降级为争议。2609-OpenWAM 在 RoboTwin2.0 上跑同一组 mask 对照,拿到的方向与 SimWAM 相反:isolated 87.41、video-sees-action 87.63,而 action-sees-video 92.39、mutual 92.15——让 action 读到 video 流值近 5 pp,而不是 SimWAM 的 0.1–0.2。两篇不是随手可归因于实现差异的对照:都用 Wan2.2-5B 系底座、都做 joint flow matching co-train、都专门做 mask 消融。因此现在的正确表述是两面并存——
- SimWAM(驾驶,NAVSIM 闭式评测):action 是否可见未来帧无差别(90.3 / 90.2 / 90.1),video 分支可零代价丢弃。
- OpenWAM(双臂操作,RoboTwin2.0):切断 world→action 通路掉约 5 pp,该通路不可丢。
最可能的解释变量是任务域:驾驶的相关状态基本由当前前视观测决定,而操作中的动作必须条件于预测出的接触与物体动力学。这只是假设,没人测过,而 OpenWAM 的基建(Apache-2.0、46 个覆盖每个消融臂的 checkpoint)恰好让这个实验可以被直接执行。在此之前,“world-model 监督只需塑形共享表示、预测的未来不必进入 policy”应当按在驾驶类任务上成立、在接触密集的操作任务上被反例挑战引用,不能当作跨域机制。
同一篇还给出一条与推理期分支直接冲突的读数:16 种异步去噪配置(video-lead / action-lead × variance-shift α∈{4,8,16,32} 与 linear-offset o∈{0.2,0.4,0.6,0.8})全部打不过同步对角线,异步最好 92.3 对 sync 93.0——“先把未来想象出来、再反解动作”这种 test-time 调度在这份数据里没有兑现。引用时须带两条限定:该图所用的评测 split 原文未点名(只能确认是 RoboTwin2.0 两设定之一),且全文没有任何误差棒。
2608-GameWAM 从另一侧补强了这条分支的前半截而不是它的后半截:去掉 future-video 监督后 MCU Mini 平均从 50.7 掉到 35.7,是”视频生成监督对 policy 有实质贡献”的少见正面定量证据。但它并未测试可丢弃性——block-cycle 控制在 rollout 期始终联合生成观测与动作,“把 video 分支在推理时整支删掉会掉多少”在交互式游戏域仍然空白。
两篇 2026-08 的工作把这个拓扑的适用面继续扩宽:2608-ZeroWAM 的 in-context future chunk prediction 模块在推理时被移除,2608-ZimaBlue 的 Fast(0.5B) 在部署期直接消费 Slow(5B) 第 12 层的 K/V 而不重跑生成。加上 2608-DALeWM 在 latent MPC 上丢弃两个辅助头、2608-DreamXPhi 的单向 depth 分支与训练期 SAM3 掩码重加权,“训练期建模、推理期剥离”已经跨出 WAM,成为整个方向的通用工程形态。
另有两条限定需要与”共享表示塑形 policy”这个结论一起传播。其一,“训练期辅助监督、推理期整支剥离”这个拓扑在非 world-model 的监督目标上同样成立:2608-StellaVLA 的自回归 spatial-language expert 以 λ=0.3 辅助 loss 参与训练、推理时完全剥离,只留 backbone 与 MLP action head 走单次前向(推理时联合解码语言要 3177 ms,剥离后 88 ms)。因此这条分支眼下支持的是”辅助监督经共享表示塑形 policy”这个更宽的结论,world model 是其中一种监督来源而非必要成分;不同监督来源之间的 matched 对照无人做过。其二,跨论文的 LIBERO-Plus 排名替代不了同 backbone 消融:StellaVLA 不含任何世界建模,零样本 85.1%,而它的最大增益也落在 camera viewpoint(+23.5),正是 JEPA-WAM 增益集中的那一列。两者 backbone、数据与训练规模均不同,这不构成反例,但说明该列可由互不相干的路径攻下——把 WAM 在该列的领先归因于世界预测监督,依据只能是上述三篇的同 backbone 消融,不能是榜单位次。
路线内分支:设计空间开始被当作受控变量来测。WAM 的主要选择——冻结什么 encoder、单体还是双流、两条流互相看不看得见、去噪同步还是异步、预训练喂什么——此前基本靠逐篇宣称,改一处要连带改一串,跨论文的分数差无法归因。三篇工作各自把一条轴拆开量,得到的读数多数不支持流行叙事。
| 被测的设计轴 | 受控程度 | 读数 | 引用时须保留的限定 |
|---|---|---|---|
| backbone 规模(2609-OpenWAM) | 同 Infra、同数据、同评测协议,只换参数量 | 1.3B 90.14 → 2B 91.64 → 5B 92.39 → 14B 93.79 | 单调但全文无误差棒;α 最终选 5B,理由是效率而非最优(Tri 92.60 > Dual 92.36 也同样被让掉) |
| embodied 预训练的收益落在哪里(2609-OpenWAM) | 四种预训练策略共用同一 SFT 与评测 | ID 87.00 → 88.50 / 87.10 / 87.68;OOD 14.50 → 23.80 / 26.50 / 26.62 | ID 侧 +0.68 pp 接近噪声带,增益几乎全在 OOD(+12.12 pp);co-train 与两阶段仅差 0.12 pp,“两种数据都用”比”用的顺序”重要 |
| 数据配方 vs 接口设计(2608-ZeroWAM) | 同底座下把 ICL 接口、task-balanced 重采样、IFP 三项分别消融 | 对 LingBot-VA 的 +29.50 pp 中,text-only 变体已达 39.44%,约 22 pp 归于重采样,接口与 IFP 净增约 7.5 pp | 论文叙事以 human-video ICL 为中心,但主对比同时换了数据与接口 |
| 视频小时数 vs 动作小时数(2608-ZimaBlue) | 四配置共用 DROID post-training 与优化 schedule,只改预训练初始化 | 36.1 → 46.1(+6K 小时跨形态动作)→ 66.9 → 77.8(+120K 小时第一视角视频) | 累加阶梯不配平总小时数与算力,只能读成工程性价比,不能读成”单位数据的信息量” |
这张表最可复用的一格是 ZeroWAM 的三分解:它是这条路线里少见的把自己的主表增益拆开、并承认大头不在自己主打机制上的做法。task-balanced 重采样单独值约 22 pp 这件事,比 in-context 接口本身更值得在别的 WAM / VLA 预训练上单独复验——如果它在别处也稳,那么一批把增益记在架构上的论文需要重算归因。ZimaBlue 则给出增益的形状而非只给总量:6K 小时动作数据改善的是执行(microwave closing 0/10 → 9/10),而 60K → 120K 小时视频的增量几乎全落在受扰 suite(Standard 只 +5.0,Perturbed +22.5)。视频小时数买到的是分布漂移下不崩,不是学会新技能。但它缺一档关键消融——保留 Fast、只移除或打乱 Slow 的 video K/V——所以 Perturbed 从 30.0 到 57.5 里有多少来自世界模型的预测内容、多少只来自 33 ms 的反应速度,目前无法分开。
OpenWAM 最硬的一击是方法论而非榜单:同一组 mask 对照在预训练前后各跑一次,from-scratch 下略优的 action-sees-video 被 mutual 反超(三个 split 方向一致)。“小规模消融选超参、大规模照搬”这个默认范式因此被正面质询。要紧的是它自证的适用边界——六个受控变量里只有 mask 这一个在预训练后被重测,backbone、encoder、架构族、去噪调度四项都是在 from-scratch、600 小时预算、单一 benchmark 下定下来就外推到 6,369 小时。
这条反转结论的证据强度需要单独标注,因为它正落在一个可证伪的位置上。支撑 Finding 3 的是 +0.16 / +0.70 / +0.72 pp 三个单次运行差,全文无任何 dispersion 估计;而该文自身可观测的表间不调和恰好同量级:Table 1 的 Dual-JSA 92.36 与 Table 2 / Fig. 6 / Fig. 11 三处一致的 92.39 对不上,Fig. 10 的 co-train OOD 26.62 与 Fig. 11 推得的 26.42 也差 0.20 pp(同一对图的 ID 侧 86.98 + 0.70 = 87.68 却精确吻合,“四舍五入”解释不成立)。据此可以给出一条待验证假设:mask 反转的效应量与该实现的 run 间方差同阶,多 seed 重测后方向可能不稳定。它是可直接证伪的——预训练的 mutual 与 action-sees-video 两个 checkpoint 及对应 SFT 臂都在 46 个公开 checkpoint 之列,同一批权重重复评测即可拿到方差。在拿到之前,“consistently preferred” 的正确读法是”三个 split 同号”。
优点:参数共享 / 部署简化;video prior 显式注入 action learning 的最自然方式;增益的可归因性开始具备基建条件(统一 trainer / policy server / 评测协议 + 覆盖每个消融臂的公开 checkpoint,2609-OpenWAM)。
缺点:算力门槛极高(Motus 18 000 GPU-hours、DreamZero 需 2×GB200);边际收益不一定大(Motus Joint mode 比 VLA mode 只 +3pp);高精度任务不 hold;action 与 imagination 的同步性可被攻击解耦(2607-BadWAM)——“部署前检查 imagined future 是否合理”的安全叙事失效;新增预测通道的边际收益存疑(2607-STWAM / 2607-N0TWAM 的消融均显示新增的预测通路不是主要收益来源)。再加两条验收侧的:误差棒在这条路线上近乎缺席,2609-OpenWAM 全文无标准差或多 seed 重复而其核心结论建在 ≤0.72 pp 的差上,2608-ZimaBlue 的真机每任务只 10 次 rollout;机制解释与受控干预普遍脱钩,OpenWAM 把 ID 侧优势归因于 video-latent 监督注入额外优化信息、把 OOD 侧劣势归因于长时域误差累积,而 λ_v 恒为 1.0 从未被扫过、horizon 从未被变动过。
5. WM-as-RL-Simulator / WM-Conditioned VLA (Loop 路线)
核心思路:用 video WM 替代物理仿真器跑 GRPO / PPO,或把 WM 预测的 future latent + value 作为 VLA policy 的 inference-time condition;policy 与 WM 迭代 co-evolve。
代表工作:
- World-VLA-Loop(Show Lab NUS, 2026-02):SANS dataset + DiT reward head + co-evolving loop。核心诊断:video WM 的 action-following 偏差让它对错 action 也生成成功 → policy reward-hack。LIBERO 三 suite +12.7% SR;real-world 13.3% → 36.7% → 50.0% 两轮迭代
- GigaBrain-0.5M*(GigaAI, 2026-02):RAMP 把 RECAP 从 advantage-only 条件化推广为 (future latent, advantage) 联合条件化;WM 联合预测 future state + value 比 only-value 精度更好
- RWM + MBPO-PPO:legged 场景证明 “long-horizon PPO + learned model” 可行
- 2606-RehearseVLA(CVPR 2026):video WM 替代仿真器对 OpenVLA-OFT 做 RL post-training(LIBERO 5-demo 设定 79.6% vs SFT 74.85%),VLM instant reflector 输出连续 reward——解决 binary reward 下 RLOO advantage 塌缩,并提供实时终止信号;无 oracle 终止评测暴露 post-success 冗余动作破坏任务状态的隐性问题(OpenVLA-OFT -11.8pp)。局限:WM 训练数据仍靠 SFT policy 在仿真器内探索采集(“摆脱仿真器”存在循环依赖),且 WM 冻结、未处理 reward hacking——与 World-VLA-Loop 的 co-evolution 形成对照;“失败/次优数据是 WM 训练关键”与 SANS 结论互证
优点:把 WM 从”能生成什么视频”转向”能否闭环训 policy”的 actionable metric;co-evolving loop 给出 reward hacking 的实证 narrative。
缺点:仿真器质量瓶颈(video WM action-following 普遍弱,2608-WorldSimProbe 进一步给出它的形状——faithfulness 随控制偏离训练分布单调退化,而 RL 探索恰恰要把 policy 推到 task 分布之外;“训练数据里含失败轨迹”不等于覆盖了 task 分布外的可行动作);Long-horizon 死穴(AR video drift >200 帧;RehearseVLA LIBERO-Long 仅 +0.8);评估样本量小。
推理期分支:WM-as-Planner。上述用法都在训练期消费 world model(当仿真器、当 condition source),WAP 把它整个挪到推理期:VLM agent 提出子目标,action-conditioned WM 在想象中评估,policy 降级为被调用的执行工具,构成 propose → optimize → search 闭环。让这一反转在视频骨干上可行的是 pose-image conditioning——候选动作先经正向运动学渲染成骨架图像、再由 VAE 编码送进 Wan-T2V-1.3B(4 视角 2×2 拼图,21 帧 @7FPS 历史 → 20 帧 @20FPS 未来),从而绕开低维动作向量与视频生成骨干之间的接口失配(与 2607-GigaWorld1 关于 channel-concat pose map 优于 cross-attention 的结论同向)。结果:compositional LIBERO-Long 四设定 72/68/78/70,对照 π0.5 的 4/0/0/0 与 cosmos-policy 全 0;新布局六设定 88/86/90/66/84/78,baseline 多为 0;zero-shot Robosuite 80/76 对纯 VLM planner 的 58/22。消融阶梯从 56/28/46/32 起,依次加入 global optimization、local search、policy rollout imagination 逐级抬升;1 次想象即胜过带 ground-truth reward 的 BoN-8(60 vs 42)——在这一设定下想象比重采样更省。
边界同样清楚:WAP 使用 URDF、相机标定与硬编码 GRASP/RELEASE 原语,“72 vs 0” 因此是”带特权信息的模块化系统 vs 端到端 policy”,不是 world model 单独的贡献,全文只有 Table 9 隔离了 world model 自身增益。世界建模指标(+11.4% ID / +16.8% 泛化)是 PSNR 与 LPIPS 的相对提升再取平均,其 limitation (g) 已自承该构造可疑。全部实验在仿真中完成、无真机,无 imagination horizon 扫描与误差累积测量,50 次 trial 无误差棒。
critic 侧分支:WM-as-Critic。上述用法都把 world model 放在 actor 一侧(当仿真器、当条件源、当规划器),2607-WCM(同济 / 上海创智学院 / 复旦)把它挪到 critic 一侧:critic 在预测 return 的同时预测下一帧的 LeJEPA latent,损失为 ,可 drop-in 替换 PPO / Flow-SDE / AWR / RECAP 四种 VLA RL 算法的原 critic,覆盖 149 个仿真任务与 7 个 WidowX-250S 真机任务。决定性的对照是 λ=0 的 history-ViT 变体——同样吃多帧历史、同样多的时序建模容量,但不带世界预测目标,结果依然无效;这把”增益来自世界预测”与”增益来自多看几帧”分开了,是这条分支目前最硬的证据。另一个值得记的读数是 λ 扫描下 OOD 成绩波动 10.6pp 而 IND 只波动 2.7pp——预测权重主要影响的是分布外行为。
边界:全文没有任何 value-accuracy 指标,因此”预测目标 → 值估计更准 → 策略更好”这条因果链只有两端被测、中间未测;LIBERO-Plus 上 one-shot SFT + 约 250 步 RL 超过 20k 轨迹 Full-SFT 的结论只领先 0.8–2.3,且部分子维度回退;OFT 的 OOD 增益仅 +0.8;LeJEPA / SIGReg 为借用组件,且 SIGReg 在 on-policy 下关闭,仿真结果实际只有 生效;baseline 无误差棒,也无训练开销对照。
reward 侧分支:给 world model 本身找可验证的监督通道。上述用法都假定 world model 已经训好,只讨论怎么用它。2608-RLHEV 把问题倒过来问:spatial generation 之所以没能走通 RLVR 式 post-training,是因为它没有 compiler 那样廉价而密集的判定器,只有 CLIP score 一类模糊代理。它提出的替代物是 game engine——engine 能对 collision、physics stability、navmesh reachability、script soft-lock 做逐项检查,开发者的 accept/reject 决策再补上一个稀疏但难以被 game 的全局 gate,两者按 0.65 human + 0.35 engine 混合成 reward。
这个 framing 值得单独记下,因为它给出的是一条可迁移的判据:判断某个生成方向能否上 RL post-training,先看它有没有一个既密集又难被 game 的判定通道,而不是先看它有多少数据和算力。engine 检查密集但可被 game,human acceptance 难 game 但稀疏,把两者按权重混合是对这组互补性最直接的操作化。可迁移性也正卡在这里——human acceptance 信号的获取成本全文没有量化,而它是整条路径能否放大的前提。
现有证据只支持把它当假设而非结论。评测是自建的 200 例 UnitySceneBench 与 ≤720 训练实例的受控研究,标题所指的 scaling 并未被验证,全文也没有报告 data engine 实际产出的轨迹数据量。跨引擎迁移的读数尤其值得警惕:同引擎内 Unity 分布偏移从 0.25 提到 0.75,而 Unity→Unreal 只有 0.25→0.35、Unity→Godot 0.15→0.35——engine 提供的可验证性目前高度绑定在具体引擎的语义上,没有跨出去。跨引擎与生成侧的分数还都来自 MLLM-as-a-judge,用模糊评判来论证”摆脱模糊代理”,这一层循环性论文自己也承认。Embodied 侧 +0.79% R2R 与 +48.43% D4RL 同时出现,缺少起点与方差说明,不宜引用。
6. WM-as-Policy-Evaluator(Robotic Policy Evaluation)
核心思路:用 learned world model 作为 robot policy 的低成本 evaluation surrogate;成功标准是 evaluator–world agreement(同一 policy 在 real 与 WM rollout 中的 outcome 一致性),而非生成质量。
代表工作:
- 2607-GigaWorld1 (🔥 Rating 5, GigaAI):WMBench——2,989 条 paired real/WM rollout + 324K challenge rollout 的 controlled study。结论:evaluator 质量取决于 long-horizon action fidelity、可迁移 physical prior、空间对齐的 action control(channel-concat Trajectory Accuracy 0.3528 vs ControlNet 0.2566 vs cross-attention 0.1620),而非短期视频观感;综合 evaluator score 超最强通用 Wan baseline 14.9%;VLM-assisted WMES 与人类评分 exact agreement 87.80%
- 2604-dWorldEval (Rating 2):discrete diffusion WM + progress token(progress=1 判 success)+ 统一 token space + sparse keyframe memory
关键 gap:video model 对 contact-sensitive failure 有 optimistic bias(GigaWorld-1 closed-loop 观察)——这是 policy evaluator 最危险的误差类型,optimistic evaluator 会系统性放行危险 checkpoint;false-success rate 应作为第一汇报指标。另两条评测线独立定位到同一处,但方向并不一致。2608-WorldSimProbe 与 optimistic bias 同向且更尖锐:作者据一次 50 例审计(观察到的 grounding failure 全部是幻觉出接触、无一是漏掉接触)把 probe 限定为 simulator 验证过的 no-contact 场景,六模型三平台上三种触发的均分是 distractor 75.0 > 空间邻近 54.5 > 外观诱导的假接触 38.6——最挡不住的正是”有接触的视觉线索但没有控制支持”。2608-WorldExam 却给出相反符号的失败:Object Interaction 的典型问题是”被接触物体保持不变”或”主体直接穿过去”,最好的 action-driven 只有 33.75。两种符号不互相反驳(前者构造无接触场景考模型会不会无中生有,后者要求发生接触考模型会不会漏掉),但合起来说明 contact 目前在两个方向上都不可靠,还没有被归结成单一机制;目前尚无对它的独立解释或复现。
第二处 gap 在验收协议本身:这条路线报出的高相关系数,多数测的不是闭环。 2608-Hydra0 在 RoboLab 上给出 5 policy × 6 任务 × 每对 10 rollout(300 episode)的 replayed-vs-reference 成功率 Pearson r=0.96、Spearman ρ=0.93、MAE 5.7 pp,按任务平均后能复现全部五个 policy 的排名。但协议写得很清楚:action flow 来自录制好的真实末端轨迹,policy 从不在生成的观测上被 query。因此它证明的是”给定已执行的动作序列,模型重渲染出的视频保留了成败信号”——这是 policy evaluation 的必要条件,不是充分条件,真正要测的”模型能否预测某 policy 在新状态下会怎么做”没有被触及。三条旁证使这个数字更需要克制引用:进入相关计算的点数 n 全文不自洽(§4.5 写 across policy-task pairs 读作 30,摘要与 contributions 写 across 5 policies 读作 5);每点只有 10 次 rollout,成功率被量化到 10% 步长,MAE 5.7 pp 不足一个量化步;policy-task pair 上的相关系数会被任务难度方差撑高,若跨任务方差主导,高 r 只说明模型分得清难易,未必分得清同任务下的 policy 差别(此为推测,无人测过)。这条路线要立得住,需要的第一个标准动作是把”生成观测上闭环 query policy”与”replay 重渲染”分成两栏分别汇报。
7. Digital-Domain World Model(Web/GUI)
核心思路:数字环境的 world model 收敛于文本语义状态空间(NL state delta / accessibility tree / 语义后果描述)而非像素——planning、安全判定、RL 训练依赖的是功能性状态变化而非视觉保真。理论依据是 2511-DreamGym Theorem 1:合成环境上训练的策略在真实环境的改进下界只由 reward 保真度 ε_R + 转移域一致性 ε_P 决定,与 raw-state 重建误差无关。
按用途分类:
| 用途 | 代表工作 | 关键证据 |
|---|---|---|
| Planning / lookahead | 2411-WebDreamer(TMLR 2025)、2600-MobiledreamerGenerativeSketchWorld、2510-RWoM | live 网站动作不可逆 → 用 LLM 想象替代真实 tree search。R-WoM 先诊断 LLM 的 next-state/milestone 尚可、full-procedure planning 无检索很弱,再把 tutorial 注入 world-model rollout 而非 policy context;OSWorld/WebArena 子集相对 WebDreamer 最多 +23.4%/+16.3%,但增益只撑到 horizon≈3、主结果限 tutorial-covered 子集 |
| Pre-execution guard | 2607-SeerGuard、2602-WAC、2608-DreamGuard | SeerGuard 重标注发现 **91% high-risk 任务是”良性指令 + 危险执行”**→ 安全评估必须下沉到 action 级;8B SFT 语义 next-state 预测超 235B 基座(Next-State-QA 0.762 vs 0.651)。WAC 通用任务纠错仅 +1.8pp / +1.3pp——guard 用途中安全判定比任务纠错收益大。DreamGuard 把 guard 的 world model 从 LLM 换成 frozen-LLM-embedding 上的 GRU-RSSM,25 ms/call 级延迟 |
| RL simulator | 2511-DreamGym(Meta)、2608-EnvACE | LLM 经验模型(CoT 推理生成转移 + reward)+ reward-entropy 课程:WebArena GRPO 7.3→13.3 零真实交互,S2R 用 <10% 真实数据反超 from-scratch;第一手证词——WebArena 真实 RL 只能 4 并发 + 手动 reset。EnvACE 走到光谱另一端:不建外部 simulator,同一 policy 换 role tag 自己彩排环境响应 |
| Trajectory synthesis | 2510-UISimulator、2507-WebSynthesis、2608-AppDeltaWorld | UI-Simulator:同等真实测试环境暴露下合成经验达 OS-Genesis 的 4×(WebArena),$0.02–0.05/轨迹;WebSynthesis:WM-guided MCTS 合成轨迹,rollback-only 训练无效(1.49%)——rollback 信号必须与成功轨迹配合;AppDeltaWorld:transition-grounded 检索 + delta code + diffusion 混合渲染,闭环 rollout 产出 33,133 条 mobile GUI 轨迹 |
| 候选动作排序 | 2609-DiscriminativeWM | 训练目标从 next-state 拟合换成 predicted-state matching:world model 自由生成文本 next state,由拿不到 instruction/history/current state/action 的固定 judge 判断能否选中真值,二元 reward 上做 GRPO。held-out matching 80.80%(WebDreamer-7B 74.51 / WebWorld-8B 70.17 / 同数据同基座 AXTree SFT 47.77,低于两选一随机的 50%);WebPRMBench 受控对比平均 BoN 55.80→72.70;WebArena-Lite 13.94%→28.48%;预测表示平均 91.6 token 对 412.7,390 对 1,568 A100 GPU-h |
| 替代昂贵执行的 reward 代理 | 2608-WMRL、2609-DreamRSI | WMRL 用 frozen prompt-only 语言模型读代码直接预测 leaderboard percentile,留约 10% group 走真执行作 anchor,isotonic 在线重标定 + inverse-variance 融合:MLE-Dojo/DSBench 上 4B/9B agent 把 GRPO 的 883/1174 GPU-hour 压到 286/349,均值同时更高。DreamRSI 把跑完的 discovery tree 冻结成 replay simulator,让候选 exploration policy 在录好的分支上零执行成本重走(Lasso 侧 317 对 550 次 discovery-agent 调用) |
| Image-based simulation | 2500-UisimInteractiveImageBased | 两阶段 UI simulator(layout prediction → layout-to-image),layout-first 符合 UI 结构化本质 |
| Online executable model / memory | 2607-ObjectCentricEnv | object knowledge(Python 类)+ procedure knowledge(必须 import object model)+ episode 后全 procedure re-execution gate;三 text-interaction benchmark 平均排名 1.75,但 verification 只保证 executable consistency,不保证语义正确,且未覆盖 GUI/开放 schema |
与 robotics WM 的分野:digital WM 的瓶颈不在算力而在转移幻觉与 reward 无外部审计——DreamGym 的经验模型既当转移函数又当 reward 函数、无独立 verifier;UI-Simulator 的 LLM transition 有状态幻觉。robotics 侧的 action-following 问题在这里表现为”对不存在的页面状态过度自信”。
2608-AppDeltaWorld 是 GUI 侧对转移幻觉给出显式结构解的第一个实例(partial 核查,下列均为 source-verified 行):app 级 action-transition index(click 落点量化到 6×12 网格)约束”当前屏加这个 action 能到达哪些页面”,检索不到受支持的 target cluster 即判 invalid——把”拒绝非法 action”从生成模型的隐式知识变成可查表结构。但它同时是”保真度排名与下游收益排名不同构”的双口径实例:CMGUIBench-500 总分 73.51 居首,功能逻辑分 S_ad/S_id(79.69/77.00)却低于图像基线 GPT-Image-2(91.73/83.40),下游 MobileGym 14.1% 落后三个同量级开源模型。两条机制性结果对整条 trajectory-synthesis 路线更有解释力:逐 action-type 拆解显示合成经验的增益在动作类型选择与停止时机(wait 14.19→72.97、click 仅 91.82→95.88)而非坐标 grounding——低保真渲染对决策层经验仍有效;consensus-reward 负结果(8 rollout 聚类,23.5% 的 group 无唯一赢家)暴露这类 world model 缺少状态等价判定,test-time verifier 用法目前不成立。另外 ADW-only 训练相对基座反而掉点、必须混真实数据——合成经验的多样性天花板由 world model 训练分布决定,恰好绕不开”敏感 app 缺真实轨迹”的原始动机区域。
2608-EnvACE 把 RL-simulator 用途推到”内化”的极端:同一个 policy 交替扮演 Act 与 Rehearse 两个角色,Rehearse 按 prompt 里的 whitelist / JSON schema 校验并生成 tool 执行结果,训练轨迹完全由 policy 自展开,role-wise GRPO 联合优化。归因对照做得干净但结论对卖点不利:从 standard GRPO 到 EnvACE 的 τ²-Bench +5.5 里,“存在自生成 rollout 通道”值 4.3(Per-role Policy 臂,即 DreamGym 族的外挂形态),真正的”内化”(参数共享)只值 1.2。推理期的 rehearse-before-commit(N 次私下彩排 → 一次真实提交)用 base-model 彩排对照排除了”多花算力就涨”的解释(sequential 下反而低于不彩排),但缺 budget-matched 的”真实环境试错 + 复位”对照臂——它是环境不提供 rollback 时被迫的替代方案,不是对该问题的回答。全文没有任何彩排保真度测量( 与真实响应从未逐条对账),且 grounding 实际来自 prompt 注入的静态调用/返回对 + 外部 LLM judge 的 reward 通道:“训练期零环境交互”只对 transition 通道成立。
2608-DreamGuard 把 guard 用途的成本结构换了个量级:DreamerV3 式 GRU-RSSM 建在 frozen Qwen3-4B 第 31 层 embedding 上,risk head 读的是执行前预测出的 successor latent state 而非当前态,split-conformal 标定轨迹级误报率,平均 0.025 s/call(比 SafePred 快 424×)。“打分预测后状态优于打分当前状态”有直接消融支撑(w/o successor prediction:F1 82.9→76.3、FPR 9.8→25.4),恰好补上 SeerGuard 缺的那个对照。代价同样清楚:模型只在 SafetyDrift 上训练与标定,跨 benchmark 后提前干预率 PHIR 从 96.3% 崩到 16.8–34.8%、AgentDojo FPR 29.4%——“多视野风险”主要成立于同分布内;且它推理期不产出任何可读的后状态,判决是纯 {PASS, HOLD, BLOCK} 标签,agent 被拦后拿不到修正依据。与 SeerGuard(每步 8B VLM、输出 rationale)合看,guard 一族当前的权衡曲面是延迟、证据可读性、跨分布鲁棒性三者不可兼得。三篇的共同缺口与本节开头的分野判断一致:EnvACE 无彩排保真度、AppDeltaWorld 无状态等价判定、DreamGuard 的”世界”是被风险标签塑形的潜向量——digital WM 的 fidelity 维度仍然没有一家直接测量。
这个判断需要在两个方向上各收一寸。其一,2608-WMRL 给出了一个例外的形态:它在 reward 通道上装了在线审计量 (anchor group 上校准分与真分的均方残差),代理信号一旦失真残差就变大,anchor 权重自动升高,梯度回落到真执行的 group 上,系统退化成普通 GRPO 而不是继续学一个坏信号。可迁移的是这个结构而不是它的两个校正项——混合比例被在线测出来,而不是事先设死。限定也清楚:审计只覆盖 reward 通道,不覆盖 transition 通道;它是探测器不是校正器;而且只探测得到落在 anchor group 上的那部分失真。其二,2609-DiscriminativeWM 质疑的是这个维度本身——如果 world model 只用于给候选动作排序而不用于把状态喂回 policy 继续推演,那么 transition fidelity 就是在为不需要的东西付钱,该测的是”预测出的状态能否把候选后果彼此区分开”。它的 data-matched 对照把这一点说得很硬:同基座同数据只换目标,AXTree SFT 的 matching 准确率 47.77% 落在两选一随机基线 50% 之下,训出来的表示在判别意义上几乎无信息。
用途分支:把昂贵的真实执行换成便宜的代理分数。这三篇与前面的 simulator 用途不同——它们不生成可供 rollout 的环境,只生成一个用来排序或打分的标量/表示,因此绕开了多步推演的误差累积,代价是把风险集中到”代理分数会不会被 policy 利用”这一点上。三者对这个风险的处理恰好构成一条阶梯:WMRL 有在线审计通道但理论把最危险的情形假设掉了,DiscriminativeWM 把判定器本身当成训练目标,DreamRSI 完全没有保真度检查。
WMRL 的理论让步值得单独记。Theorem 4 的偏差收缩依赖 Assumption 6,即 world model 的偏差必须是真分的单调畸变 。在这个假设下最大化预测分就等于最大化真分的单调变换,policy 原理上无法利用代理——而可学习奖励代理之所以危险,恰恰因为它们的错误与 policy 能搜到的结构相关(某个被高估的库调用、某种让预测分变高的写法),这类偏差是 的函数而非 的函数,isotonic regression 只在预测分这一维上拟合标量映射,看不见它。定理覆盖的正是把 reward hacking 假设掉之后的世界。另有两条引用限定:论文缺等算力下的 anchor-only GRPO 对照臂,而消融显示 Online Debiasing 单开就已在全部四列超过真执行 GRPO(15.7/28.1/19.4/31.7 对 15.2/25.7/18.8/31.2),起作用的可能是那张用真执行数据拟合的重标定映射而不是 world model 流;anchor 比例论文内部不一致(正文脚注约 10%,附录”每步 8 group 至少 1 个真执行”意味着下限 12.5%)。
DiscriminativeWM 的风险在同一处但换了方向:reward 完全由 Qwen3-32B judge 定义,训练等价于把 world model 优化到”能被某个 LM judge 区分”。换 judge 的检查是必要的,但三个 judge 同代、共享偏置无法互证,而领先幅度从训练 judge 的 +6.29 收窄到 Llama 的 +3.21,方向上正是”部分收益来自对训练 judge 适配”所预期的。它的训练分布也与部署分布不匹配——pairwise 的负例只从轨迹里恰好观察到的其他动作取,而端到端用的是 Bo5,五个候选由同一个 GPT-4o 提议且可能高度相似;13.94 → 21.82 → 28.48 中 Bo5→Bo5+state 的 +6.66 pp 缺一个”喂打乱的 predicted state”对照。制品三项全部 Coming soon。
DreamRSI 的可复用点在 meta 层的位置而非 world model 本身:底层 coding agent、evaluator 与全部模型权重不变,只有 exploration policy 的代码在变,改进因此发生在可读可审计的策略代码里。它同时是这条分支上审计缺位的极端——replay 只能重放录过的分支,超出冻结轨迹计数的计划拿不到 reward,全部实验单次运行无方差估计,offline dreaming 自身的 LLM 成本不计入论文的 Compute 口径。它给出的正面读数(Lasso 侧 317 对 550、1879 对 3200 次 discovery-agent 调用)应按”同初始化、策略冻结对照下的单次运行”引用。
8. Planning Efficiency (相关方向)
代表工作:2604-AgenticCache (Rating 2)
核心思路:利用 plan locality,cache-based plan reuse 替代 per-step LLM calls。+22% success rate,-65% latency,-50% token usage。
9. Conceptual Framework (Survey)
代表工作:
- 2604-AgenticWorldModel:Levels × Laws taxonomy(🔥 Rating 5,最系统的 Survey)
- CSUR:implicit/predictive 二分 + cloud-side / edge-side 切分
- 2607-PixelsToStates(Alaya Lab):用 game engine 的 action–state–observation loop 重构 interactive WM 版图——真正缺口在显式 state、规则驱动 transition、持久后果与 consequence latency(结果应在规则定义的时刻出现而非输入后立即显现),不在画面生成;附 Black Myth: Wukong 90+ 小时 frame-aligned engine-state 数据引擎,为 explicit-state WM 提供稀缺监督
- 2607-MentalWorldModeling(MWM / Mentis):Levels × Laws 中 Social 约束域在本 survey 的第一篇正面工作——把 belief / goal / intention / emotion / norm 从”事后 rationale”升格为 world state 的一等成分,状态空间因子化为 ,观测定义为从第三人称联合状态渲染出的 target 第一人称部分观测(允许与真实心理状态不符,这正是 false belief 得以被表达的形式化理由),动作写成 (physical carrier, mental content) 的耦合对,物理转移不直接条件于 mental content。实例化为 training-free 的六阶段 pipeline Mentis + 448 条 process-annotated 的 Menti-Bench(2,688 个 gold 后继状态)。最值得借用的是它的审计模板:necessity ladder(S0 options-only floor 31.3 → S1 direct 63.3 → S2 CoT 74.6 → S3 SC@6 77.9 → S4 free-text state 80.3 → S5 structured state 82.6 → S6 full MWM 87.9,human 98.5,每级只增加一个建模承诺)+ channel intervention + oracle cascade,其中 oracle 增益的 sub-additivity(四个单增益之和 8.7 > 四者组合 6.3)干净地量化了模块化 pipeline 的跨阶段误差税。边界:全文只报 final-action F1,6.2 节与 Appendix G 定义的 mental fidelity / perspective-leakage rate / process-outcome divergence 一个数值都没报,因此”涨点是因为心理状态被正确建模”没有中间证据;消融是纯信息移除、无等量非心理内容的对照,且移除 physical 通道(−16.5)比移除 mental 通道(−12.1)代价更大,与标题重心相反;S6 的调用量约为 S1 的二十几倍而全文无 token 成本表;Menti-Bench 的 gold 按 MWM 自身 taxonomy 标注、gold 动作由同一批作者裁定为”唯一可辩护最优”,S6 天然享有 schema 对齐红利;单步转移、封闭 6 选项动作空间
- 2606-EnvEngineeringSurvey:以 environment lifecycle 而非单个 model 组织领域——八属性二分 × 八 domain → symbolic/neural synthesis → correctness/diversity/complexity/fidelity evaluation → agent/environment co-evolution。它补充 Levels × Laws 的“能力/约束”视角:world model 只是 neural environment synthesis 的 pixel/word/latent 三层之一;survey 自身也承认 correctness 之外三项质量维度 under-researched,co-evolution 仍是未来方向而非已完成机制
- 2608-WorldProxy(position paper,partial 核查):把 world modeling 从”预测物理状态转移”放宽为 Agent-Centric World Proxy——interaction step 取代物理时间步、information transition 取代 state transition,六类 proxy function(Dynamics / Spatial / Execution / Memory / Skill / Reward-Verification)× 三级介入深度(Proxy-L1 推理期提示 / Proxy-L2 训练期信号 / Proxy-L3 共演化)张成 6×3 设计空间,两个自认空格(Spatial×L3、Reward×L3)可当选题指针。按其笔记核查须带三条限定引用:全文零实验、零检索协议,分类是先验断言而非从证据聚出的结构;其头号主张”world model 应按让 agent 变好多少验收而非生成保真度”在 2604-AgenticWorldModel(共享两名作者)已作为 decision-centric evaluation 具名提出、本文未就此致谢;且存在一处 contradicted 的引用错误——把 I-JEPA / V-JEPA 2 举为 raw-pixel 预测的例子,而两者恰是 latent 预测的代表作,后续引用不得从它转录这一归类。它的真实用处是暴露本 survey 的一个覆盖习惯:我们默认把 world model 等同于像素/几何/语义转移预测,而 Memory / Skill / Reward 形态的”环境代理”(2603-Memoir 的 imagination-as-retrieval-query、2607-SeerGuard 的二值风险判定)被归到别处——这一观察成立的依据是库内已有笔记,而非其分类学本身。三套顶层切法(Ding 的 understanding/predicting、Chu 的 Levels × Laws、本文的 proxy functions × 介入深度)在 20 个月内相继出现且互不兼容、都未降级为可测量对象——taxonomy-heavy, evidence-light 是该方向 engineering-heavy, insight-light 之外的第二个症候
- 2608-CombodiedAgents(position paper,22 作者 16 机构):把建模对象从环境换成人。其 Personal World Model 的功能契约写作”在不同干预下这个特定的人的 state–event 轨迹如何展开”,输出的是校准过的未来轨迹分布——与 action-conditioned prediction 是同一个接口,只是环境位置上坐的是用户。形式化里有三处对本 survey 有迁移价值的选择:human-state transition 显式含用户自身动作与外生项(承认 agent 的干预不决定状态演化,这与机器人 WM 默认 action 完全决定 transition 恰成对照)、效用保持为向量不 scalarize、consent/safety/reversibility 写成 admissible set 硬约束而非 reward penalty,干预在该集合上做 Pareto 选择。落在 Levels × Laws 里它属 Social 约束域,与 2607-MentalWorldModeling 分工不同:MWM 建的是他人心理状态的单步转移并给了 448 条标注与消融,本文建的是长时程个体轨迹但零实验、零数据、零代码,CombodiedBench 是 8 模块蓝图,agency preservation 类指标(如 calibrated reliance)无可操作化定义。Table 1 的 12 类对比同样是作者自建的先验分类学且含 strawman 成分——这是上一条指出的第二个症候在 Social 域的又一例
10. 诊断式评测:把总分拆成可定位的失效环节
这条路线的共同主张是总分不可诊断:一个 aggregate score 说不出模型是没跟住动作、还是跟住了但交互不对。分歧在按什么轴拆,目前有四条。2608-WorldExam 按后果的来源拆——指令写明的 vs 须从场景自行推断的;2608-WorldSimProbe 按因果链的环节拆——动作是否被实现,以及环境响应是否由已实现的运动支持;2608-PAWBench 按结局分布拆——同一初始观测与动作重复采样后,经验分布的支撑与概率质量是否都对;2608-HarnessEvalW 拆的不是被评对象而是评测器自身,把打分改写成逐 case 路由技能、留下证据树与跳过理由的 agent 流程。四者的评测对象也基本不重叠(WorldExam 与 HarnessEval-W 含闭源视频生成 API,WorldSimProbe 全是可本地训练的 ACWM,PAWBench 取 11 个通用视频生成系统),读数互补而非冗余。前三条共享一个前提——评测器本身可信;第四条把这个前提本身变成被测对象,但它自己又退回了 WorldExam 明确拒绝的那条聚合口径(详见 10d)。
10a. 按后果来源拆:explicit fulfillment 与 inherent reactivity
核心问题:现有 world-model benchmark 绝大多数评的是 explicit instruction fulfillment——预先指定 layout、相机轨迹、动作序列或交互后果,再检查它是否被实现。这漏掉了一整类能力:从初始状态可以推出、但指令里完全没有描述的后果。主体走上台阶时高度应随地形变化并保持接触,靠近障碍物时应出现接触、绕行或阻挡,进入另一个 agent 的社交距离时对方应有反应——这些都不是输入的直接描绘,而是场景条件下的推论。2608-WorldExam 把它命名为 inherent reactivity,并把”评什么”从单一总分改成四个分别报告的诊断层级——Visual Quality、Control Adherence、Spatial Consistency、World Reactivity,共 8 个任务、1,474 个 case。放回 Levels × Laws 的坐标里,前两层大致仍在考 L1 Predictor,后两层才踏进 L2 Simulator;这让 2604-AgenticWorldModel 的层级框架第一次有了对应的可测量刻度,从而能回答”现有模型卡在 L1→L2 的哪一步”。
两处设计决定了它的结论能否被引用。其一是 interface adaptation:把可控行为写成 atomic control unit 的有序组合,再适配成 SE(3) 相机轨迹、离散动作序列或自然语言,把 camera-、action-、language-driven 三类模型放到同一批 case 上;代价是语言 prompt 只保留控制顺序、不含各段时长,其恢复轨迹须先用 change-point detection 切段再逐段比对,而另两类按预分配帧区间比对。其二是两条 track、不出全局总分:static-scene track(Camera Control + Scene Revisit)三类范式全跑,dynamic-interaction track(Subject Control + 五个 reactivity 任务)只跑 9 个能可靠控制第三人称主体的模型,Goal Completion 仅限 language-driven,明确拒绝把”接口不支持”记成”做得差”。camera-driven 因接口只控相机整体而全数排除在 dynamic track 之外,这与 2607-Wonder 划出的 camera-controllable renderer 与 action-conditioned simulator 之分是同一条界线,只是这次由评测口径给出。case 构造上,reaction 类任务只给一个触发用的控制、把由此诱发的场景反应整个留空,这个”留空诱因”的原则本身不限于视频生成。
核心读数是一次方向反转(下列数字的原文一致性已核查):Control Adherence 上 action 接口领先,World Reactivity 上 language 接口大幅领先,且反转幅度远大于领先幅度。
| 任务 | action-driven 最好 | language-driven 最好 |
|---|---|---|
| Subject Control | 55.47 | 37.28 |
| Terrain Interaction | 27.49 | 64.39 |
| Object Interaction | 33.75 | 75.96 |
| Social Interaction | 60.37 | 85.10 |
| Physical Reaction | 33.43 | 63.84 |
| Goal Completion | 接口不支持 | 85.33 |
论文对失败模式的描述是:把请求的主体运动变成相机运动或让场景静止;让被接触物体保持不变或让主体穿过去;让附近 agent 毫无反应。Terrain Interaction 这一列尤其硬——它先用 Subject Control 分数做 gate、未通过直接记 0,而 action-driven 的 Subject Control 明显更高,这个 gate 系统性地更宽容 action-driven,它们仍只有 27.49 对 64.39。“水平控制准”与”垂直地形适配”因此是两件事。
视觉质量与其余三层解耦,且证据是多点位的:dynamic track 上 language-driven 的 General 均值挤在 79.64–81.04 这个 1.4 分窄带里,Task 均值却从 39.85 铺到 65.02;ReCamMaster / FantasyWorld 的 General 是 80.97 / 80.23,Camera Control 只有 38.64 / 18.46;Kling 2.5 的 General 均值在 language-driven 中最高(81.04),Goal Completion 只有 48.25。三处证据分布在不同范式与不同层级上。可靠性一侧,VLM judge 与人的一致性为 Spearman 0.8614 / PLCC 0.8583(800 实例、5,793 个 checklist item、3 名标注者多数票),分任务最低是 Social Interaction 0.7019;把几何后端从 VGGT-Ω 换成 Depth Anything 3 后,static track Overall 平均绝对相对变化 3.09%(camera-driven 0.44% / action-driven 3.08% / language-driven 5.36%)、dynamic track 平均 0.57%,且 dynamic 各范式内排名全部保持。
证据边界(须随数字一起传播)。接口范式与模型档次共线是最主要的问题:dynamic track 上 action-driven 只有两个本地部署模型,language-driven 七个全部走 API,“action 接口 → 世界不反应”与”这两个特定模型 → 世界不反应”在这份数据里分不开,而论文自己承认闭源系统的 proprietary prompt enhancement 可能参与场景 grounding 与执行规划——这条限制未被列入 limitation。范式内方差大于范式间差距:language-driven 的 Kling 2.5 dynamic Task 均值 39.85 低于 action-driven 的 LingBot-World 39.91,范式内跨度达 25 分,“language-driven 更会反应”实际由 Veo 3.1 / Vidu Q3 / Hailuo 2.3 三个最强系统撑起。四个 checklist 任务的 ground truth 由未具名的 LLM case composer 起草、image-conditioned refiner 改写后定稿,人工介入只在候选初始图筛选;上述 human alignment 验证的是”judge 按给定 checklist 打分与人一致”,不是”checklist 抓对了该发生的反应”。judge 只看均匀采样的 10 帧,而 Social Interaction 与 Physical Reaction 要判的恰恰是时序性质,10 这个数无敏感性分析。六个动态任务的初始场景全为合成图、未说明生成模型与候选数,与 static track 的真实数据集输入分布不同源;每个 case 只跑一次生成,无重复采样方差。引用”20 个模型”时须注明那是 static-scene track 的规模,reactivity 层实际只有 9 个。数据与评测工具包写的是”will publicly release”,目前只有项目主页。
10b. 按因果链环节拆:Observable Simulator Contract
核心问题:ACWM 要当 simulator,定义性要求不是生成一个 plausible 的未来,而是生成 supplied action 在当前场景下物理诱导的那个特定未来。2608-WorldSimProbe 把这句话写成两个可观测的连锁条件:action-realization consistency(生成的 agent motion 对应输入动作,r̂ ≈ Φ_R)与 interaction-response consistency(环境响应由已实现的 motion 与初始环境状态物理支持,ê ≈ Φ_E)。Φ_R、Φ_E 本身不可观测,做法是构造受控 intervention 去测它们的可观测后果,因此失败可以被定位到具体环节而不是记进一个总分。与之配套的是一个 coverage 论证:物理 simulator 覆盖全部可执行轨迹分布 A_phys,而 ACWM 通常只在窄得多的 A_task 上训练与评测,A_task 里含失败轨迹并不构成对 task 分布外可行动作的覆盖——这条论证直接决定了下面几个结论的适用范围。
五个 probe suite(前三测 action realization,后两测 interaction)、18,608 个实例、6 个开源 ACWM(IRASim / Ctrl-World / BWM / DreamDojo 四个 action-injection 架构 + LingBot-VA / Cosmos-3-Nano 两个 unified action–video 架构)、三个平台(RoboTwin / ManiSkill / LIBERO)。协议上最关键的是每个实例先在 simulator 里完整执行并通过 validity 过滤、manifest 在模型推理前冻结,六模型共享同一初始观测、动作流、simulator seed、reference horizon 与三个 diffusion seed——反事实因此有可执行的 ground truth,这是纯视频 benchmark 拿不到的。
读数分三层。排名层:跨平台 mean pairwise Spearman ρ=0.695,LingBot-VA 领先 RoboTwin(51.6)与 ManiSkill(63.5),Ctrl-World 领先 LIBERO(55.5)、其余平台第二;两类架构都横跨高低名次,架构不解释 simulator faithfulness。suite 级排名与 Overall 排名也不一致,单个环节强不代表整体 fidelity。退化形状层:T2 的 cross-task receiver–donor replay 中,六模型 fidelity 随 receiver 与 donor 的 motion mismatch 增大而整体下降(平均 Spearman ρ=−0.433,RoboTwin),与”偏离熟悉轨迹时模型愈发依赖 scene/task 关联的 motion prior”一致;T3 里全部六模型在 π0.5 late checkpoint 轨迹上比 early checkpoint 高 10.8–16.1 分(RoboTwin),说明即便动作仍是 task-directed,只要执行风格不熟悉 realization 就退化。T1 的 StackCube case 给出量级:simulator 的 action-failure 边界在 0.05,LingBot-VA 要到 0.374(7.48×)、Cosmos-3-Nano 要到 1.78(35.6×)才表现出失败。交互层:T4 三种触发的跨模型均分为 distractor 75.0 > spatial proximity 54.5 > appearance-induced false contact 38.6;T5 的 8 个 interaction primitive 上,primitive 间差异大于模型间差异——tap 40.8–56.9、shake 0.0–1.2,六模型均分区间只有 17.7–21.8,是跨模型共享的 primitive-specific 缺陷而非某个架构的问题。
两条方法层结论对本 survey 之外的评测同样适用。其一,下游可用性只在 OOD 控制下才能区分模型:用各 ACWM 生成的合成数据训 policy,standard 轨迹上成功率挤在 78–86%(六模型扩展后 78–89%)难以区分,OOD 轨迹上分离成 Ctrl-World 53% / BWM 34% / Cosmos-3-Nano 21% 且与 benchmark 排序一致——success-oriented 的训练评测会掩盖熟悉控制之外的 fidelity 差异。其二是 evaluator 有效性:750 条人工标注 rollout 上,Diverse/OOD controls 的 RMFA 与人类分级评分 ρ=0.750,明显高于 VLM 二元判断(一致率 0.450)与 IDM(ρ=0.284);其中 VLM judge 对 91.7% 的样本判 positive action following,人类只判 42.2%。IDM 的问题被定位为 inverse-model decoding failure 而非 fidelity 信号——在正确的 simulator reference 上,IDM 误差对 OOD control source 即已升高 3.1×/5.6×。这两条对库内所有用 VLM judge 判 action-following、或只在 task 分布内报下游成功率的评测都是直接修正。
证据边界:全部在仿真内、单一外部视角,未触及真机 rollout、长 horizon 闭环与 deformable/多物体交互;测的是各模型在各平台官方 split 上按其 released recipe 单独 fine-tune 后的 fidelity,不能直接外推到通用 pretrain ACWM 的 zero-shot 表现;ρ=−0.433 与 late/early 10.8–16.1 两项只在 RoboTwin 上报告;downstream 只有一个 RoboTwin task,作者自称受控 case study;T5 的 primitive 标签判定仍由 VLM judge 给出(reference set 上与多数人工标签一致率 94–97%、生成样本上 93–95%),shake 这类极低分 primitive 的绝对数值受 judge 分辨力影响的程度未单独 ablate。
10c. 按结局分布拆:probabilistic alignment
核心问题:前两条切法都在单条 rollout 内部拆,因此都默认”存在一个该被生成的未来”。抛硬币、Galton board、保龄球在同一初始状态与同一动作下有多个合法结局,而 planning 需要的正是”哪些结局可能、各自概率多大”。2608-PAWBench 把这个要求拆成两层互不蕴含的条件:support alignment(所有 distinct outcome 都能被实现,分布不塌缩到子集)与 probability-mass alignment(各 outcome 以正确比例出现)。两层必须分开报告,因为一个模型可以 diverse 而不 aligned——覆盖全部结局不代表分配了正确概率。benchmark 因此分成两个 track:25 个有解析或对称性参考分布的场景按 TVD 打分,25 个结局可枚举但概率不指定的场景按 valid-support recovery 打分;50 个场景覆盖 8 组物理机制,每场景每模型 K=50 次独立 rollout,由 Gemini 3.5 Flash 按场景专属 rubric 映射到 terminal outcome,≥20/50 可读才通过 readout gate(通过率记为 SPR)。
三层读数(原文一致性已核查)。第一层是能力层:11 个视频生成系统没有一个同时做到概率质量对齐、宽支撑覆盖与跨场景可靠——校准最好的是 Cosmos 3 Super I2V(TVD 20.5,SPR 80.0%),覆盖最好的是 LTX-2.3(71.7%),而后者的 Calibration SPR 只有 24.0%,两个最优不是同一个模型。第二层是排除性论证,这一层决定这条切法能否成立:从参考分布抽 matched 样本的 Monte Carlo 基线平均 TVD 只有 8.33(99% 的模拟均值低于 9.22),而 11 个生成器平均观测 TVD 是 31.2,且每个生成器的观测值都超过其自身 matched 基线的 99 分位。K=50 的有限采样噪声因而被定量排除,剩下的偏差是模型分布本身错了。第三层是失准的形状:模型对改变物理转移的 causal 干预(改变铅笔倾角)分布偏移不完整或方向错误,对不改变物理的 non-causal 视觉线索(Galton board 上的文字)分布却发生偏移——underreact to causal, overreact to non-causal。
这第三层与路线 10b 的读数同向且构造独立:2608-WorldSimProbe 的 no-contact probe 上,六个 ACWM 最挡不住的恰是外观诱导的假接触(三种触发的跨模型均分 distractor 75.0 > proximity 54.5 > false contact 38.6)。两篇一个测分布、一个测单条 rollout,一个用通用视频生成系统、一个用机器人 ACWM,共同指向同一个机制假设:条件化更多地挂在表观相关上,而不是挂在物理转移上。这个假设目前没有被任何一篇直接测量,但它是两组独立证据共同支持的最简解释。
失准修不掉,三条路各有各的断点。语言侧:即便用 Oracle prompt 直接给出目标 outcome,生成器也只实现 37.6–58.1% 的请求结局;而 VLM 自己预测的 outcome 分布同样失准(5 个 VLM 的 TVD 落在 34.8–42.3),因此”让 VLM 当 controller 去指定分布”两头都有错。噪声侧:Couple to Control 对 K=50 个初始噪声引入负相关耦合、保持各样本的标准 Gaussian marginal,把 Wan2.2 的 Coverage 从 63.4% 提到 69.2%、LTX-2.3 从 71.7% 提到 74.8%——这是在既有分布内采样得更充分,不是重塑学到的分布。训练侧:5 个 left-fall 视频比例从 0% 到 100% 的 LoRA adapter,概率偏移随比例非线性变化,且没有一个能同时匹配 upright(对称)与 left-leaning 两个场景的参考分布——改训练分布是全局的,缺的是按物理状态自适应的能力。三条干预的共同结论是同一个:现有手段只能在既有分布内移动样本,state-conditioned 的分布重塑还没有对应的训练目标。
证据边界。判定链条依赖 VLM judge,而这个 judge(Gemini 3.5 Flash)正属于 §5.1 证明分布失准的那一族模型;81.3% 的人类一致率只在双方都给出明确标签的 888/1,500 子集上成立,rubric 映射的系统性偏差无法从这份数据里排除。口径上,Coverage 与 TVD 的均值只在通过 readout gate 的场景上计算,SPR 差异大时跨模型可比性受损——LTX-2.3 的 71.7% Coverage 建立在 Calibration SPR 24% 之上,引用单指标排名必须带 SPR。适用域上,只比较 terminal outcome,不覆盖轨迹级动态与中间物理过程;Calibration 的参考分布依赖对称性假设,而真实世界里”ground-truth 分布已知”的场景本身稀少,这直接约束了这条切法能扩展到多远。
10d. 按评测流程拆:把评测器本身做成可审计的 agent
核心问题:前三条切的都是被评对象,评测器本身的可靠性是被默认的前提。2608-HarnessEvalW 把这个前提变成被测对象——不用一条固定 rubric 给整段视频打分,而是逐 case 路由到不同技能、留下证据树与跳过理由,18 个视频世界模型 × 330 个 case、3 个轴 8 个 setting。它给出的可迁移读数有两条,方向相反。
正面读数是判定稳定性,不是判定准确性。与人类的一致性在模型层面是 Spearman ρ=0.93(Intentional,Kendall τ=0.82)与 0.87(Physical,τ=0.74),对照来自 9 个模型上的 5,000 次人类 A/B 判断经 Bradley–Terry 聚合。与 WBench 在同一批视频、同一个 GPT-5.5 后端上的对拍更有信息量:Physical 轴的 pairwise accuracy 从 31.9% 升到 71.7%,同时 draw 率从 52.2% 塌到 1.8%;Intentional 轴 60.2% 升到 77.8%,draw 率 36.1% 降到 11.1%;模型分数的稳定性包络从 WBench 的 1.61 个 BT 单位收窄到 0.33(4.9×)。把这两组数按同一分母重算即可看出增益的来源:Physical 轴上 WBench 真正下判断的只有 47.8% 的对子、其中判对 66.7%,HarnessEval-W 下判断 98.2%、其中判对 73.0%——准确率只动了 6 个百分点,头条上的 40 个百分点几乎全部买自”敢不敢下判断”。Intentional 轴更尖锐:下判断比例从 63.9% 升到 88.9%,而判对的比例从 94.2% 降到 87.5%。这一步反推只用到原文报告的 accuracy 与 draw 两个数,论文自身未作此分解。可迁移的判据因此是:任何声称 agentic judge 涨点的工作,都应把 pairwise accuracy 按 decisive 子集重新归一,否则分不清它提高的是判别力还是决断率。
反面读数是这条路线的纪律并非单调前进。HarnessEval-W 的 Overall 是 330 个 case 上的非加权算术平均,这意味着”接口不支持这件事”会被记成”做得差”——恰是 2608-WorldExam 用两条 track 明确拒绝的那条口径。同一篇里就有它自己的证据:Trans-I 轴排名第 1 到第 10 全是 Prompt I2V 类系统,最好的非 Prompt-I2V 只有 56.8 而榜首 83.6。这个分布形状与”哪类模型更懂意图”同样可以由”哪类接口能接住这个 case”解释,而论文没有区分。三个轴的相关系数也建议重读:Obs-R 与 Obs-P 的 Pearson r=−0.04(两轴近乎独立,支持分轴报告的设计),但 Trans-I 与 Trans-P 的 r=0.98——在当前这批模型上,意图转移与物理转移几乎共线,分开报告暂时不提供增量信息。
最有价值的单项读数是微调的代价形状。两个针对世界模型用途微调过的视频模型,相对各自的通用底座都呈现同一种交换:HY-WorldPlay 1.5 对 HunyuanVideo 1.5 是 Revisit +8.4、Intentional −24.2、Physical −11.2;DreamX-World 对 Wan 2.2 是 Exploratory +4.8 / Revisit +7.8 / Offscreen +3.5,同时 Intentional −11.9、Physical −7.2。两次独立微调都用 intervention-following 与 physical plausibility 换取了 revisit 与记忆一致性。这与路线 1 把长时程 revisit 当作首要攻关目标的取向直接相关——如果这个交换是普遍的,那么 2608-WorldTrace 这类专攻寻址与记忆的改进也需要报告意图与物理轴上的退化量,而目前没有一篇这样做。边界是这只有两组对照、每组一对模型,且底座与微调数据都不公开,因果归因还差很远。
证据边界。人类对照只覆盖 8 个 setting 中的 2 个、18 个模型中的 9 个,未报告标注人数与 inter-annotator agreement,因此这套评测的人类天花板未知,ρ=0.93 也无法与”人自己跟自己有多一致”对照。机制侧三项关键消融全缺:没有实验把”分解成子技能”与”rubric 更细”分开,路由与分解的错误率从未被测量,证据树的忠实性也从未被验证——换言之,“agentic 分解是增益来源”这个因果链条只有两端。论文所称”换不同 VLM 仍稳健”实际是同一个 GPT-5.5 在 temperature 0 下重跑三次,不构成跨模型稳健性。全文无 Limitations 节。
11. 可执行程序作为世界表示
核心思路:把世界状态写成一段可读、可改、可执行的程序,动力学由引擎或仿真器解算而不是学出来,生成模型退居为把状态渲染成像素的部件。这条路线与路线 1–4 的赌注方向相反:后者把越来越多的世界逻辑吸进生成模型,前者把逻辑从生成模型里抽出来放进代码。它买到的东西是前几条路线原理上给不出的——带单位的精确 state、近乎免费的 counterfactual、可被人逐条检查的假设,以及不随 horizon 累积的动力学一致性(2609-SparseResidualWM 的 horizon-20 rollout 输给 no-op 基线这类失败在这里不会发生,因为动力学不是拟合出来的)。代价是覆盖面被 DSL 与引擎锁死:域外它只能拒绝,而学出来的 video WM 至少会对任意输入吐出一个(也许错的)未来。
代表工作:2608-CodeAsWorld(程序从观测反解)、2609-ProgrammableWM(程序驱动画面);路线 7 的 2607-ObjectCentricEnv 是同一机制在文本环境里的实例,路线 9 的 2607-PixelsToStates 从缺口一侧论证了同一件事。
两篇分工互补,各解决这条路线的一半:
| 2608-CodeAsWorld | 2609-ProgrammableWM | |
|---|---|---|
| 世界写成什么 | MuJoCo scene.json + SDK,分 physical composition / dynamic evolution / visual appearance 三部分,可独立 inspect / modify / execute | 实体·属性·关系·规则四元组,由 coding agent 写成 engine-readable program;health / inventory / faction 这类无视觉表现的变量也由引擎显式维护 |
| 程序从哪来 | agentic discovery loop:propose–instantiate–execute–render–verify,K=5,预算内不达标即拒绝该样本 | 3D detector 从首帧恢复布局 + 用户自然语言,由 agent orchestrator 一次合成,无正确性检验 |
| 生成模型的位置 | 训练数据管线里的 renderer(Wan2.2-VACE 做 sim-to-real 重渲染),推理时不再有任何可执行物 | 推理期 renderer:冻结 LingBot-World-v1 + Structured Spatial ControlNet,条件是 3D OBB 确定性编译出的 identity / semantic / direction 三张 pixel-aligned 控制图 |
| 被验收的命题 | 仿真器导出的精确 world-space 标签能提升 VLM 的单目尺度标定(QuantiPhy 159 题,9B 平均 MRA 55.4 对 Gemini-3.1 Flash 54.8) | 画面里的存活角色数与死亡事件是否与引擎记录一致(CombatStateBench 50 clip,Count 94.00 / State 98.00 对 LingBot-World-V2 40.75 / 8.00、YUME 32.00 / 58.00) |
这条路线最扎实的选题在监督缺口而非表示优越性。真实视频几乎不带 world-space 物理量标注,所以”从单目视频估物体真实尺寸、位移、速度、加速度”这类任务在 latent / video WM 路线上根本没有监督来源——2608-JEPAWAM 的预测目标是 frozen encoder 的 patch 特征,2608-SimWAM 的是像素,2608-GameWAM 的是未来帧加键鼠动作,三者都回答不了”这个球此刻是多少 m/s”。可执行世界免费导出 SI 单位的 state trajectory,这是 2608-CodeAsWorld 的实际贡献,也是它真正被实验验证的那个命题。
但两篇论证的命题与验证的命题都不是同一个,而且是同一种错法。CodeAsWorld 用整节论证 code 优于 pixel / 3D / language,全文没有任何表示对照实验;ProgrammableWM 的 Sec 2 是一整篇表示选择论(text / 2D box / mask / 3D OBB / G-buffer 谱系),Sec 5 一次表示对比都没做、全文零 ablation。同一个方法论缺口在两篇互不相关的工作上重复出现,值得当成这类工作的默认怀疑:判断”表示选择”类论文时先问哪张表比较了表示,而不是先看论证是否漂亮——对照实验要求把竞争表示各训一遍,成本高且结果未必有利。
ProgrammableWM 的主表测的不是 programmability。Count Accuracy 问画面里存活角色数是否等于引擎记录数,State Accuracy 问死亡事件有没有被画出来;而 PWM 恰恰把每个实体该占哪块像素、语义标签是什么,以 dense pixel-aligned 控制图直接送进了 ControlNet——答案就在输入里。一个没有任何引擎、由人手写同一批 OBB 序列的系统会拿到相同分数,所以 53.25 / 90.00 这两个百分点差只能归给 conditioning interface,不能归给 programmable engine;而两个 baseline 只能靠 prompt switching 接收状态转移,dense 空间条件打赢文本条件几乎是先验成立的。缺的那一行对照很具体:同一个 LingBot-World-v1 底座、不挂 ControlNet、只用 prompt switching。现有三行里没有一行能把 ControlNet 的贡献与 v1→v2 的代际差分开——Imaging Quality 上”更旧的底座 + ControlNet”只比 V2 高 0.16 这个反常结果正是这个混淆的副产品。分母也须一并记住:Count Accuracy 摊在 400 帧上、State Accuracy 摊在 50 个死亡事件上,后者最小刻度 2 pp,“98 对 58” 实为 49 对 29 个事件。还有一处论文自己没点破的结构:LingBot-World-V2 的 Count 高于 YUME(40.75 对 32.00)而 State 低到近地板(8.00 对 58.00),两个 baseline 在 prompt-switching 协议下的失效模式是正交的——一个照着 prompt 演出死亡却把计数搞乱,另一个保住计数却几乎不执行事件;把两者并列成”implicit state 的失败”抹掉了这个差别。
这条路线目前最可迁移的东西是 ProgrammableWM 的 training–inference asymmetry 论证,而它没有被任何实验检验。训练时结构表示是从已实现的动态里抽取的(动态先发生,表示后被标注出来);推理时系统拿到的是一个高层状态转移,必须主动构造出对应的时变结构表示再交给生成模型实现。所以”训练数据里拿得到某种表示”完全不蕴含”推理时写得出它”:说一个角色摔倒很容易,构造它的身体姿态与肢体轨迹很难。由此得到一条可判断的边界——表示越细,系统就越是从”指定世界里什么变了”滑向”指定这个变化在几何与动力学上如何展开”,最终退化成动画、motion generation 或物理仿真要解的高维实现问题。这个判断对库内所有”给生成模型加结构条件”的工作都直接可用。论文自己就有一个现成的实例没有量:训练时的 direction 态由检测器估计的 box 中心位移量化而来,推理时却来自引擎的解析 velocity;训练时的”摔倒”是套在关节体上的抖动 box 序列,推理时的”摔倒”是一次刚性 box 旋转。把这个 gap 做成可测量的量(对同一段真实动态,分别测从视频抽取该表示的误差与从状态转移程序化构造该表示的偏差),是这条路线最具体的后续。
规则由谁执行这条轴目前只有三个点且互不相比:StatePlay 让模型联合预测观测与状态、MASS 用 learned Logic Engine 推进状态、2609-ProgrammableWM 用手写规则执行状态。三者对”转移误差如何被吸收”给出完全不同的答案,而 PWM 准确指出了另外两个的弱点却没做任何实验对比——它现有的两个 baseline 连显式状态接口都没有,赢它们证明不了”规则必须可执行而非被学习”这条主张。
优点:给出 latent / video WM 拿不到的精确带单位监督;counterfactual 与场景编辑的成本接近于零;世界假设以人可读的代码形式存在,2608-DALeWM 抱怨的”planning cost 不可审计”与 2608-WorldSimProbe 观察到的”看起来 plausible 的幻觉接触”在原理上都能定位到具体参数;rollout 一致性由引擎兜底,不随 horizon 累积漂移。
缺点:覆盖面由 DSL 与引擎决定,当前都只有刚体,流体 / 布料 / 断裂各需接一个新引擎并教 agent 正确调用;物理不是被发现的而是被作者写好的,agent 搜索的只是固定先验下的参数与初始条件,更接近 system identification 而非机制假设——CodeAsWorld 主文的 discovery 分析用的还是 animation engine(时变 pose 规定运动、不从力导出),真正的 physics engine 结果在附录;外观最终仍要还给视频生成模型,所以这条路线并没有替掉 video WM,而是把它降级为接在显式 state trajectory 之后的 conditional renderer(这也是两篇里最站得住的架构主张,比”code 是更好的表示”有力);进入代价高且靠筛数据换成功率,CodeAsWorld 的 video-driven 侧要三个感知模型预处理加至多五轮验证,而 WISA-80K 的过滤留存率全程未报告——“离开被筛出来的那类场景还剩多少”正是与 video WM 对比时最该给的数字;验收普遍不足,CodeAsWorld 的 159 题 benchmark 上领先 0.6 分且 discovery loop 的收益从未连到下游分数,ProgrammableWM 的 coding agent 生成正确率、规则覆盖与冲突、用户改一句话后世界是否如预期改变全部未测,唯一被量化的转移类型是最容易被 OBB 姿态表达的”死亡”。
路线间对比小结:
| 路线 | 代表 | 主要 use case | 推理代价 | 主要 open gap |
|---|---|---|---|---|
| Pixel video diffusion | Cosmos / DreamGen / IRASim / Wonder / WorldTrace / ABot-World-0 | Data engine / Evaluator / camera exploration | 14B × 多步 → 秒级;ABot-World-0 5B 在单张 RTX 5090 上 12.4–15.8 FPS(口径完整) | Action-following / world reactivity / physics / AR drift;memory 已从容量问题改判为寻址问题并有 training-free 修法,但”该记住哪些位置”的写入策略仍未解;分布层同样未达标(结局分布的 TVD 约为同样本量采样噪声的四倍,且 prompt / 噪声耦合 / LoRA 三类干预都改不动) |
| Latent JEPA | V-JEPA 2 / RWM / Orca | Agent brain / MPC | 16s → ms 级 | Goal spec / cross-embodiment / 不生成像素 |
| 3D/4D generative | HY-World 2.0 / OccSora / RynnWorld-4D / Latent-to-4D / PointWorld | Scene generation / driving sim;PointWorld 分支做 action-conditioned dynamics 与 MPC | 分钟级/场景;PointWorld 单步预测实时 | 场景合成分支无 action 接口、dynamics 依赖伪标注几何;共有缺口是几何/flow 误差到下游任务成功的映射从未被量化 |
| Unified VLA+WM | UWM / Motus / DreamZero / FlowWAM / ABot-M0.5 / ST-WAM / N0-TWAM / SimWAM / JEPA-WAM / World Tokens / MobileWAM | VLA policy backbone;训练信号子族部署时删除 WM 分支 | 百 ms 级(工程后);训练信号子族与纯 VLA 同量级 | 算力门槛 / unify 必要性 / action–imagination 同步性 / 新增预测通道归因不清 / 丢弃想象在长程任务上是否无损未测 |
| WM-as-RL-simulator | World-VLA-Loop / GigaBrain-0.5M / RehearseVLA | VLA RL post-train | 30 h / 任务级 | Action-following / 样本量 |
| WM-as-critic | WCM | VLA RL 的 critic 辅助预测目标 | 与原 critic 同量级 | 无 value-accuracy 指标 / 增益幅度小且部分子维度回退 |
| WM-as-planner(推理期) | WAP | test-time 子目标搜索,policy 作工具 | 每候选一次视频生成 | 增益未与特权信息分离 / 无真机 / 无 horizon 扫描 |
| WM-as-evaluator | GigaWorld-1 / dWorldEval | Policy checkpoint 筛选 | 视频生成级 | contact-sensitive failure 的 optimistic bias |
| Digital text/code-space WM | DreamGym / UI-Simulator / WebDreamer / SeerGuard / R-WoM / OCM / WMRL / DiscriminativeWM / DreamRSI | Planning / RL sim / 轨迹合成 / safety guard / executable memory / 替代真实执行的 reward 代理 | LLM 推理级($0.02–1/轨迹) | 转移幻觉 / reward 无外部审计 / executable≠correct;代理分数只在”偏差是真分的单调畸变”这一假设下安全,而可学习代理的错误恰与 policy 能搜到的结构相关 |
| 可执行程序 WM | Code-as-World / Programmable World Model(文本域 OCM 同构) | 精确 world-space 标签 / 可编辑 counterfactual / 规则驱动的可玩世界 | 反解侧每样本至多 5 轮仿真渲染验证;渲染侧与所挂视频底座同量级 | 覆盖面被 DSL 与引擎锁死(当前只有刚体);两篇都论证表示优劣却都无表示对照实验;程序生成正确性与规则覆盖未被量化 |
Datasets & Benchmarks
| Dataset | 规模 | 评估指标 | SOTA | 特点 |
|---|---|---|---|---|
| HM-World | 59K 视频 | Subject Consistency, Background Consistency | HyDRA 0.926/0.932 | UE5 渲染,exit-entry 场景 |
| Agent-World | 1,978 环境 / 19,822 工具 | MCP-Mark | 14B 13.3% | MCP servers + PRD 采集 |
| GenerativeWorldRenderer | 4M 帧 RGB+G-buffer | FID, LPIPS | DiffusionRenderer | 游戏截取 |
| VSI-Bench | - | Spatial Reasoning | SpatialEvo 46.1 | 3D 空间推理 |
| ItTakesTwo | 多人游戏 | FVD, PSNR | MultiWorld | Multi-agent gaming |
| RoboFactory | 多机械臂 | Action Accuracy | Concat-View 92.0 | Robot manipulation |
| LIBERO | - | Success Rate | dWorldEval, CF-VLA 83.0% | Robotic policy evaluation |
| RoboTwin | - | Success Rate | 87.02% (Motus,超 π0.5 45%) | Robotic manipulation |
| CALVIN | - | Success Rate | CF-VLA | Long-horizon manipulation |
| Push-T | 推块任务 | IoU | 0.961 (IRASim model-based planning) | Planar manipulation,policy evaluation 与 GT simulator 相关度 0.99 |
| DreamGen Bench | 22 novel behaviors | Success Rate | DreamGen | World model 泛化评测(新动词/新环境解锁) |
| TokenBench | Video tokenizer | PSNR / FVD | PSNR 35.85 (Cosmos) | Video tokenizer 质量评测 |
| WMBench | 2,989 paired real/WM rollouts, 8 任务类 | WMES / evaluator–world agreement | GigaWorld-1-Plus 0.6834 | policy evaluation 专用,episode-disjoint split(2607-GigaWorld1) |
| WorldArena | 121 帧 @24fps | EWMScore / Trajectory Accuracy | FlowWAM 63.71 / TrajAcc 64.26 | action-conditioned 视频 WM 评测 |
| MobileSafetyBench | 250 任务(150 high-risk) | RCS / SUS | SeerGuard RCS 0.130 | GUI agent 安全;91% 风险在 action 级而非 instruction 级 |
| Black Myth: Wukong data engine | 90+ 小时 30FPS | - | - | frame-aligned engine state + raw control + RGB/depth(2607-PixelsToStates) |
| Wonder I2V / V2V | 1,000 images×5 trajectories / 500 videos×6 trajectories | VBench average + translational/rotational RPE | I2V 0.8558 / 0.0132 / 0.0784;V2V 0.8527 / 0.0187 / 0.1119 | 作者自建、未给 release URL;V2V 仅一 baseline;camera control 非 agent action(2607-Wonder) |
| Physics-IQ | 生成式物理一致性 | Verified IQ-Score | 41.2(2607-PhiZero,> Cosmos3-Super 39.5 / Wan2.2-14B 32.2) | 评的是”生成得像不像物理”,与判别类指标可给出相反排序 |
| IntPhys2 | 判别式直觉物理(violation-of-expectation) | Accuracy | Overall 56.34 / Hard 52.38(2607-PhiZero;随机 50,V-JEPA 57.42) | 生成端 SOTA 在 Hard split 逼近随机——WM 用作 planner/evaluator 时应以此类指标验收 |
| LikePhys / WorldModelBench | 分材料物理合理性 / 综合 | 各自 score | Rigid 29.14 最佳、Fluid 53.15 倒数第三;Total 8.19(2607-PhiZero) | 物理能力按材料分层,聚合分掩盖流体等薄弱项 |
| LIBERO-Plus | 10,030 例 / 七维扰动 | 零样本 Success Rate | π0.5+JEPA 86.3(其表内 best overall);无 robot-policy pretraining 组 JEPA-WAM 79.2;此前 ST-WAM 72.8(Fast-WAM 51.5);非 WM 对照 StellaVLA 85.1 | LIBERO 的扰动版,已成为 WAM 视觉鲁棒性主力评测;ST-WAM 与 JEPA-WAM 的 baseline 数字均引自第三方/同期工作而非重跑;JEPA-WAM 的领先集中在 Camera 列、Language 列落后 ResVLA/RoVLA 达 20+ 分;StellaVLA 不含任何世界建模却也把最大增益落在 camera viewpoint(+23.5),说明这一列可被无关路径攻下,跨论文名次不能替代同 backbone 消融(2607-STWAM、2608-JEPAWAM、2608-StellaVLA) |
| UniVTAC | 8 个触觉操作任务 | Success Rate | N0-TWAM 84.5(InternVLA-A1 67.1) | 唯一第三方公开的触觉 manipulation 套件;纯视觉 WAM 在此反而落后 VLA(FastWAM 48.0 / LingBot-VA 31.4),该异常低水位未被解释(2607-N0TWAM) |
| Menti-Bench | 448 条(320 text / 100 image / 28 video),2,688 个 gold 后继状态 | final-action F1 | full MWM 87.9(human 98.5) | 心理-社会状态的 process-annotated 世界建模评测;只报 outcome 级指标,且 gold 与被测 pipeline schema 同源(2607-MentalWorldModeling) |
| WorldExam | 1,474 case / 8 任务 / 4 诊断层级;static track 20 模型、dynamic track 仅 9 模型 | 四层分报(几何重建 + GPT-5.5 checklist),不出全局总分 | 各范式最好:Subject Control 55.47(action);Object Interaction 75.96 / Goal Completion 85.33(language) | 唯一把”指令写明的后果”与”须自行推断的后果”分开报告的 WM 评测;引用”20 个模型”须注明 reactivity 层实际只有 9 个;数据与 toolkit 尚未发布(2608-WorldExam) |
| WorldSimProbe | 18,608 实例 / 5 个 probe suite / 6 个开源 ACWM;RoboTwin 5,498 + ManiSkill 6,610 + LIBERO 6,500 | 按契约两环节分报(RMFA / oracle-relative calibration / TAPNext++ 位移判据 / VLM primitive judge),不出跨环节总分 | LingBot-VA RoboTwin 51.6、ManiSkill 63.5;Ctrl-World LIBERO 55.5 | 每个实例先在 simulator 内执行并冻结 manifest,反事实有可执行 ground truth;全部在仿真内、单一外部视角、模型均为 in-domain fine-tune(2608-WorldSimProbe) |
| LoopBench | 4 个难度轴 12 配置,每条件 100 初始场景 | PAC(自参考:对照模型自己 first-visit 生成的帧,不需外部 GT 视频) | WorldTrace-Landmark ABA N=16 PAC 0.864 vs sliding window 0.723 | 专测 ABA 回访一致性;同一 ABA 配置在不同表格的绝对 PAC 差异大(0.723 / 0.540 / 0.837),跨表数字不可混用;由提出方法的同一团队构建、尚无第三方结果(2608-WorldTrace) |
| WorldRoamBench | 七个子维度(Strict/Partial Acc.、Traj.、Mechanics、Aesthetic、Imaging、Memory) | 各维度分报 | HappyOyster 领先五项;Genie 3 领 Imaging 与 Mechanics | ABot-World-0(5B)七项全为第二或第三,Memory 0.5041 对 Genie 3 0.6073 / HappyOyster 0.6309;benchmark 作者与被测方的 Benchmark Team 高度重叠,且 LingBot-World(14B)/ HY-World 1.5(8.3B)仅 0.11–0.32 的异常低分未获解释(2607-ABotWorld0) |
| PointWorld 3D dynamics 数据集 | 约 2M 轨迹 / 500 小时,DROID 真实 + BEHAVIOR-1K 仿真,覆盖 single-arm Franka 与 bimanual humanoid | 1 秒 horizon 的逐点 ℓ2 mover 误差 | B1K held-out 达 sub-centimeter mover 误差 | 3D 标注由无标注三阶段管线自动生成(FoundationStereo → VGGT 外参对齐 → CoTracker3 lift),恢复 DROID 中 >60% 的可靠 3D point flow;ℓ2 到任务成功率的映射未量化;开源为截稿时的未来式承诺(2606-PointWorld) |
| Text4D-200 / I4D-200 | 各 200 case 的 locked benchmark | DINO-F1(投影式,appearance-dependent) | Text4D-200 57.01 vs matched Wan2.1-14B+4RC 53.56;I4D-200 61.60 vs 55.79 | 直接 latent→4D 对同 latent 级联的对照;作者明确 DINO-F1 不建立 metric 4D accuracy,且全部证据在单一 Wan VAE family 内(2608-LatentTo4D) |
| PAWBench | 50 场景 / 8 机制组(25 Calibration + 25 Coverage),每场景每模型 K=50 rollout | 分布层双指标:TVD×100(↓)与 valid-support recovery(↑),另报 readout gate 通过率 SPR | Calibration 最佳 Cosmos 3 Super I2V 20.5(SPR 80.0%);Coverage 最佳 LTX-2.3 71.7%(其 Calibration SPR 仅 24.0%) | 唯一测结局分布而非单条 rollout 的 WM 评测;带 matched Monte Carlo 基线(8.33 对观测均值 31.2)定量排除采样噪声解释;judge 为 Gemini 3.5 Flash,人类一致率 81.3% 只在 888/1,500 明确子集上成立;均值只在过 gate 的场景上算,跨模型引用须带 SPR(2608-PAWBench) |
| HarnessEval-W | 18 个视频世界模型 × 330 case,3 轴 8 setting | agentic harness 逐 case 路由技能并产出证据树;Overall 为 330 case 非加权算术平均 | 与人类的模型层 Spearman ρ=0.93(Intentional)/ 0.87(Physical),对照 9 模型上 5,000 次人类 A/B 的 Bradley–Terry 聚合 | 同视频同后端对拍 WBench,Physical pairwise accuracy 31.9%→71.7% 而 draw 52.2%→1.8%——按 decisive 子集归一后判对率只从 66.7% 到 73.0%,Intentional 更是从 94.2% 降到 87.5%,增益主要买自决断率;Overall 把”接口不支持”记成”做得差”,Trans-I 前十名全为 Prompt I2V;无标注人数与 IAA、无分解/rubric 分离消融、无 Limitations 节(2608-HarnessEvalW) |
| QuantiPhy | validation 集 159 题,四子集非加权 macro-average | MRA×100(无法解析成有限数记 0 分) | Code-as-World-VL-27B (Reasoning) 58.6;9B 55.4 对 Gemini-3.1 Flash 54.8 | 测单目视频的 world-space 物理量估计(尺寸/位移/速度/加速度),标签由可执行世界导出;159 题上领先 0.6 分、无 seed 无误差棒,27B 为 step-60 单次采样;表下半部分低分多为解析失败而非能力差异(2608-CodeAsWorld) |
| CombatStateBench | 50 clip,由与训练数据同一套 Data Engine 自产并经自动 verifier 筛选 | Count Accuracy(摊 400 帧)/ State Accuracy(摊 50 个死亡事件,最小刻度 2 pp)+ 四项 VBench 1.0 维度 | PWM 94.00 / 98.00 对 LingBot-World-V2 40.75 / 8.00、YUME 32.00 / 58.00 | 测引擎状态与画面的一致性,但条件图已携带答案,差距归于 conditioning interface 而非 programmable engine;两个 baseline 只能靠 prompt switching 接收状态转移;judge Qwen3.6-27B 无引用无校验;benchmark 与训练集共用同一标注管线(2609-ProgrammableWM) |
Key Takeaways
- SpatialEvo 的 DGE 是唯一真正的 insight——确定性几何替代 model voting,但适用场景极窄
- L3 Evolver 层级仍是 open problem——现有 world model 无法自主修正
- Video World Model 的 memory 机制有问题——HybridMemory 发现动态主体出画再入画会消失/扭曲
- Agent-World 的 environment scaling 有价值,但 MCP-Mark 绝对分数暴露问题
- UI World Model 的 layout-first 设计是对的——UISim 的 decomposition 符合 UI 结构化本质
- Progress token 是有趣的新 idea——dWorldEval 将任务完成状态编码进 world model,与 L3 Evolver 概念关联
- RL for World Model 正在兴起——World-R1(Flow-GRPO)、SpatialEvo(GRPO)都用 RL 而非架构修改
- Plan locality 有价值——AgenticCache 发现 embodied tasks 的 plan locality,cache-based reuse 显著降低 latency
- VLA efficiency 优化显著——CF-VLA 83.0% success + -75.4% latency
- Action-following 是 video WM 的致命伤——World-VLA-Loop 证明 video WM 对错 action 也生成成功 → policy reward-hack,SANS 式 near-success 数据 + reward head 是初步答案
- Latent vs pixel 路线之争进入可比较阶段——V-JEPA 2 给出 15× 计算优势 + success rate 反超 Cosmos;DreamZero 反过来用 14B pixel WAM 达到 62.2% task progress
- WM × VLA 的七种耦合方式全部被实证验证——offline data engine → inference-time latent conditioning → joint model → RL simulator → evaluator → test-time planner(2607-WorldActionPlanner)→ RL critic 的辅助预测目标(2607-WCM)
- scale 不能 alone 解决 physics——Cosmos 7B vs 14B 在 rigid-body benchmark 上 IoU 基本不变(0.59 vs 0.60)
- “video model as data engine” 是可 scale 的新 sub-paradigm——DreamGen 从单一 pick-and-place teleop 数据解锁 22 个新动词 / 10 个新环境
- PID > RL 在 sparse reward 场景——RWM 的 autoregressive training + imagination-PPO 可换 250M transitions 的 model-free 水平
- Evaluator 质量 ≠ 视觉保真——2607-GigaWorld1 用 paired rollout 证明 evaluator–world agreement 取决于 long-horizon action fidelity + physical prior + 空间对齐 action control;channel-concat 条件化的 Trajectory Accuracy 是 cross-attention 的 2.2×
- WAM 的”可检查想象”安全叙事被击穿——2607-BadWAM 证明 black-box 视觉扰动可让 action 与 imagined future 解耦(96.5%→43.1%);runtime monitor 应检查”action 能否实现 predicted future”而非 future realism
- Digital WM 不需要像素保真——2607-SeerGuard(8B 语义预测超 235B 基座)、2511-DreamGym Theorem 1(ε_R+ε_P 与重建误差无关)、2510-UISimulator(合成经验 4× OS-Genesis)从安全/理论/训练三个角度收敛到同一结论
- “降级使用”是 WM 落地的普遍模式——预测精度不足时选容错性高的用途:2603-Memoir 用 imagination 作 retrieval query(错了只是检索差一点)、2411-WebDreamer 只做 H=1 lookahead、2607-SeerGuard 只做二分类风险判定;对 WM 精度要求越低的用途落地越早
- 失败/次优数据是 WM-as-simulator 的关键 ingredient 获再次确认,但它买到的覆盖比想象的窄——2606-RehearseVLA 探索数据是最大单因素(Goal 68.4→86.4),与 World-VLA-Loop 的 SANS 结论互证;2608-WorldSimProbe 补上限定:物理 simulator 覆盖的是全部可执行轨迹分布 A_phys,ACWM 训练与评测都在窄得多的 A_task 上,A_task 里含失败轨迹并不构成对 task 分布外可行动作的覆盖。两条不矛盾——探索数据在任务内有效,跨任务的动作变异仍是空的
- Memory 必须分开讨论 storage、active compute、可寻址性与 semantic faithfulness——2607-Wonder 固定 active KV set 只解决 attention cost,不限制 full historical KV storage;2603-HybridMemory 测动态主体 exit–reentry、Wonder 只给静态 revisit qualitative case,两者尚不能互相替代。2608-WorldTrace 加进第四个轴并把它排到前面:即使内容还在 cache 里,rollout 超出训练 horizon 后 temporal RoPE 的 query–key offset 落到训练分布外,attention 读不到它——静态场景 revisit 的第一约束是寻址而非容量。2607-ABotWorld0 从反面提供同一处的证据:它把 KV cache 设成 bounded + rolling eviction 换取消费级 GPU 实时性,代价正是 Memory 成为其七个评测维度里相对最弱的一项(0.5041 对 Genie 3 的 0.6073)
- Digital WM 的 grounding 开始分化为 external prior 与 executable structure 两条路线——2510-RWoM 用 tutorial 把 imagined rollout 延长到约 3 steps,2607-ObjectCentricEnv 用 object/procedure code + re-execution gate 维护一致性;共同边界是“有依据/能执行”仍不等于环境语义真实
- World model 不能脱离 environment lifecycle 单独评估——2606-EnvEngineeringSurvey 将 model 放回 modeling→synthesis→evaluation→application 闭环,并指出除 correctness 外的 diversity/complexity/fidelity 仍 under-researched;这解释了为何视觉保真、action faithfulness 与 downstream policy success 长期互不等价
- 生成保真不蕴含物理判别——2607-PhiZero 在 Physics-IQ 拿下 41.2(生成端第一)的同一模型,IntPhys2 Hard 只有 52.38(随机基线 50),LikePhys 流体倒数第三。Takeaway 16(evaluator 质量 ≠ 视觉保真)由此从 evaluator 场景推广为 WM 的一般性质:凡消费判别能力的用途(planner / evaluator / safety guard)都不能用生成指标验收,而分材料、分难度的判别 split 是目前唯一能暴露这一差距的手段。2608-WorldExam 从第三个角度给出同向的独立证据:同一批模型的视觉质量层几乎不含区分度(language-driven General 挤在 79.64–81.04),任务层却铺开 25 分(39.85–65.02),另有 ReCamMaster / FantasyWorld 的 General 80.97 / 80.23 配 Camera Control 38.64 / 18.46、Kling 2.5 的 General 最高配 Goal Completion 48.25。三处证据切的层不同(生成 vs 判别、视觉质量 vs 任务能力、几何类 vs checklist 类),结论同一:视觉指标不构成对 WM 能力的验收
- WM 的用法从训练期扩展到推理期,且想象比重采样更省——2607-WorldActionPlanner 把 policy 降级为工具、规划全程在想象中完成,1 次想象胜过带 ground-truth reward 的 BoN-8(60 vs 42);但该系统带 URDF、相机标定与硬编码抓放原语,“72 vs π0.5 的 4” 是模块化+特权信息 vs 端到端的对比,仅 Table 9 隔离了 world model 自身贡献——归因清楚前不可引作 WM 的能力证据
- 给 WAM 增加新的预测通道,收益未必来自”预测”那一半——2607-STWAM 的语义未来必须与 VAE 未来并存(DINO-only future 39.7 < 纯 VAE 的 51.5),2607-N0TWAM 的预测触觉输给反应式的观测触觉(去 observed 掉到 70.5 / 29.6,去 predicted 只掉到 71.8 / 41.1),且预训练规模才是 UniVTAC 上最大的单一因素(84.5→65.4)。两条独立证据同向,但均为库内单篇、无独立复现,应作为 WAM 表示设计的边界条件而非定论
- 检索式上下文的收益是有条件的,条件不满足时为负——2607-STWAM 的三个对照(无锚点 DINO history 56.5 / 仅当前帧语义 62.3 / VAE history 64.7)全部低于完全不用 intent 条件的 66.4;收益要求 query 被当前状态锚定 且 被检索表示对无关扰动不变,缺一即掉点。这与 GUI / long-horizon agent 里”多喂历史反而掉点”是同一现象的不同实例
- 正则项的好坏取决于梯度场而非统计功效——2607-QQWorld 指出 Epps–Pulley 的恢复力在偏差超过 后超指数衰减,正好放过最该被拉回的离群点,而 quantile–quantile 匹配的梯度对偏差线性;换掉正则后 latent WM 的 planning 平均 79.75→85.08、tail rate 0.315→0.123。可迁移的判据是:一个善于度量分布差异的统计量未必是好的训练目标
- world prediction 也可以放在 critic 一侧——2607-WCM 让 critic 联合预测 return 与下一帧 latent,drop-in 替换四种 VLA RL 算法的 critic;λ=0 的 history-ViT 对照(同样的时序容量、没有世界预测目标,依然无效)把增益与”多看几帧”分开。但全文无 value-accuracy 指标,中间机制未被直接测量,增益幅度也只有 0.8–2.3
- “世界”里缺的那一块是人在想什么——2607-MentalWorldModeling 把心理变量升格为随动作演化的状态变量,填上 Levels × Laws 中长期空置的 Social 约束域;但它自己的消融显示移除 physical 通道代价更大(−16.5 vs −12.1),且只报 outcome 级指标——目前证据支撑的是”结构化 prompting 有效”,不是”心理状态被正确建模”
- 控制被执行不等于世界会回应——把”指令写明的后果”与”须自行推断的后果”分开报告后会出现方向反转:2608-WorldExam 中 action 接口在 Subject Control 领先(55.47 对 37.28),却在 Terrain / Object / Physical Reaction 上落后 37 / 42 / 30 分,反转幅度远大于领先幅度;Terrain 那一列的 gate 还系统性地偏袒 action-driven,差距依然成立。这在 action-following(错动作也生成成功)之外定位了一个独立失效面——动作被照做了,世界不动。边界是接口范式与模型档次共线:dynamic track 上 action-driven 仅 2 个本地模型对 language-driven 7 个 API 系统,“接口属性”与”模型档次”在现有数据里分不开
- contact 是三条独立评测线共同定位的失效点,但它们指的方向不一致——先前把 2607-GigaWorld1 的 optimistic bias 与 2608-WorldExam 读成”同向收敛”是过早的。2608-WorldSimProbe 与 optimistic bias 同向且更硬:其 50 例审计中观察到的 grounding failure 全部是幻觉出接触、无一是漏掉接触,据此构造的 no-contact probe 上六模型最挡不住外观诱导的假接触(三触发均分 distractor 75.0 / proximity 54.5 / false contact 38.6)。WorldExam 的失败却是相反符号——“被接触物体不变”或”主体穿过去”,最好的 action-driven 只有 33.75。两者不互相反驳,因为构造相反(一个考会不会无中生有,一个考会不会漏掉),但合起来说明 contact 在两个方向上都不可靠,还没有被归结成单一机制。这处争议比任何单向结论更值得写进 mental model:引用”contact 是 WM 的弱点”时必须带上是哪个方向,否则会把两组不可合并的证据算成两票
- “world-model 监督只需塑形共享表示、预测的未来不必进入 policy” 已从共识降级为按任务域分裂的争议——支持侧是三组来自不同团队、不同架构接口的消融:2608-SimWAM 让 action attend 未来帧不涨点(90.3 ≈ 90.2 ≈ 90.1),2608-JEPAWAM 把预测的未来表示直接喂 action expert 掉 6.1 个点,2608-WorldTokens 的非排他路由让 video 目标与 action 目标竞争(94.1 vs 97.0)。反对侧是 2609-OpenWAM:同类底座、同样的 joint flow matching、同一组 mask 对照,在 RoboTwin2.0 上方向相反——isolated 87.41 / video-sees-action 87.63 对 action-sees-video 92.39 / mutual 92.15,切断 world→action 通路掉约 5 pp。最可能的解释变量是任务域(驾驶的相关状态基本由当前前视观测决定,接触密集的操作则必须条件于预测出的物体动力学),但这只是假设、无人测过。正确引用方式是带上任务域:在驾驶类任务上成立,在双臂操作上被反例挑战。配合 Takeaway 26(新增预测通路不是主要收益来源),“训练期消费、部署期丢弃”子族(另含 2608-MobileWAM / 2607-STWAM / 2608-ZeroWAM / 2608-ZimaBlue)在工程层面仍是稳定形态,但它的机制解释现在只覆盖一部分证据;另一条未决边界是长程任务上丢弃想象是否无损,无人测过。另一条边界来自机制的外延:同样的”训练期辅助监督、推理期剥离”拓扑在非世界建模的监督上也成立——2608-StellaVLA 的 spatial-language expert 以 λ=0.3 与 action 目标并行训练、推理时整支剥离(联合语言解码 3177 ms 对纯动作缓存路径 88 ms),因此当前证据支持的其实是更宽的命题”辅助监督通过共享表示塑形 policy”,world modeling 只是其中一种监督源;库内还没有一篇在同一 backbone 上横向比较不同监督源
- digital WM 的 fidelity 维度至今没有一家直接测量——2608-EnvACE 从未把彩排响应与真实执行结果逐条对账(其归因还显示”内化”只值 +1.2、自生成 rollout 通道值 +4.3),2608-AppDeltaWorld 的 consensus-reward 负结果暴露状态等价判定缺失(23.5% rollout group 无唯一赢家),2608-DreamGuard 的”世界”是被风险标签塑形的潜向量、跨分布后提前干预率 96.3→16.8。三篇用途各异(RL simulator / 数据引擎 / guard)而共享同一缺口,把 2606-EnvEngineeringSurvey 点名的 fidelity under-researched 从 survey 判断落成三个可测的具体实验(彩排对账、状态等价判据、第二个长程分布的 leave-one-out)
- 长时程 visual persistence 先受限于寻址,其次才是容量——2608-WorldTrace 把 KV cache 里”存了读不出”落成可量化的机制:MG2-1.3B 上训练期最大 offset 为 5,rollout 到 offset=30 时最快的三个 RoPE 频率分量相位已越过 3π,贡献退化为噪声;相应地,naive 在旋转空间做平均压缩会因 phase cancellation 破坏 summary,key 必须存在 canonical 空间、读取时再单次旋转到分配好的 in-distribution virtual position。固定压缩方式只改 position 的消融给出 TempSSIM 超 Block-relative +5.9%/+2.8%、超 Centroid-linear +9.5%/+13.8%。最有信息量的是那个负结果:把 WorldTrace 的 position 方案接到 MemRoPE 的写入器上反而更差(p<0.001)——position 分配与内容写入必须在同一 offset 分布下协同设计,不能当作两个可自由组合的模块。边界是主结果只在单个 1.3B 游戏 world model 上,LingBot-World 仅附录级验证且 Field 在其上几乎无增益,且 2× horizon 处无显著增益
- simulator faithfulness 随控制偏离训练分布单调退化,而架构不预测它——2608-WorldSimProbe 在六个 ACWM 上给出两处一致读数:cross-task replay 的 fidelity 随 receiver–donor motion mismatch 增大而下降(平均 Spearman ρ=−0.433),且全部六模型在不熟悉执行风格(early-policy checkpoint 轨迹)上比熟悉风格低 10.8–16.1 分——即使动作仍然 task-directed。同时 action-injection 与 unified action–video 两类架构都横跨高低名次,跨平台排名一致性却有 ρ=0.695,说明可比的是模型个体而非架构族。这条对所有把 WM 当 RL simulator 或 policy evaluator 的用途都是直接约束:探索恰恰要把 policy 推到训练控制分布之外。边界是全部在仿真内、模型均为 in-domain fine-tune,两项机制性分析只在 RoboTwin 上报告
- VLM 二元 rollout judge 在 OOD 控制上系统性偏乐观——2608-WorldSimProbe 的 750 条人工标注对照中,VLM judge 对 91.7% 的样本判 positive action following,人类只判 42.2%;同一批数据上 RMFA 与人类分级评分的 ρ=0.750,VLM 一致率仅 0.450,IDM ρ=0.284(且 IDM 的误差被定位为 inverse-model decoding failure——在正确的 simulator reference 上,其误差对 OOD control source 即已升高 3.1×/5.6×)。这直接影响库内一批依赖 VLM judge 的 action-following 与 rollout 质量评测的可读性。需要同时记住的限定是它并非”VLM judge 不可用”:WorldSimProbe 自己的 T5 primitive 判定仍用 VLM judge,只是先在 human-verified reference set 上验到 94–97% 一致率——差别在于判的是有明确 checklist 的 primitive 标签,而不是”这个 rollout 跟住动作了吗”这种二元整体判断
- 显式 3D 表示在预测误差轴上给出了 log-linear scaling,但这条曲线还没有接到任务成功率上——2606-PointWorld 把 state 与 action 统一为 3D point flow 后,模型(50M→1B)与数据(5%→100%)两轴在 log 空间都近似线性地降低 ℓ2 mover 误差,这是本 survey 中少见的可预测投资回报曲线。但主指标是 1 秒 horizon 的逐点 ℓ2 flow 误差,作者自己也指出绝对误差的小差异可能对应显著的 rollout 保真度差异;真机成功率同时方差极大(Drawer 90% 而 Book 20% / Microwave 30%),且需人工或 VLM 指定 task point 与 target。因此它不构成对 Takeaway 13(scale 不能 alone 解决 physics)的反例——两者测的根本不是同一个量,而”ℓ2 降到多少才换来任务成功”正是这条路线缺的验收环节
- 单条 rollout 合理不蕴含结局分布正确,且这个差距不是采样噪声、也不是现有手段能修的——2608-PAWBench 把同一初始观测与动作重复 50 次转成经验分布后,11 个视频系统无一同时做到概率质量对齐与宽支撑覆盖,校准最好的(Cosmos 3 Super I2V,TVD 20.5)与覆盖最好的(LTX-2.3,71.7%)不是同一个模型。排除性论证是这条结论的承重墙:matched Monte Carlo 基线平均 TVD 只有 8.33、99% 模拟均值低于 9.22,而观测均值 31.2 且每个生成器都超出自身基线的 99 分位。三类干预随后划出可修性的边界——Oracle prompt 下生成器只实现 37.6–58.1% 的请求结局,负相关噪声耦合只把 Coverage 提 3–9 pp(在既有分布内采样更充分),LoRA 改训练比例是全局的、5 个 adapter 无一能同时匹配对称与倾斜两个场景的参考分布。缺的是 state-conditioned 的分布重塑目标,这是目前没有任何训练目标对应的空格
- 世界模型的条件化更多挂在表观相关上而非物理转移上——这是两组构造相反、对象不重叠的评测同向支持的机制假设:2608-PAWBench 观察到模型对改变物理转移的 causal 干预(铅笔倾角)偏移不完整或方向错误,却对不改变物理的 non-causal 视觉线索(Galton board 上的文字)产生分布偏移;2608-WorldSimProbe 的 no-contact probe 上六个 ACWM 最挡不住的恰是外观诱导的假接触(三触发均分 distractor 75.0 / proximity 54.5 / false contact 38.6)。一个测分布、一个测单条 rollout,一个用通用视频生成系统、一个用机器人 ACWM,最简解释是同一个。该假设尚无任何一篇直接测量,可证伪的做法是构造视觉表观不变而物理参数改变、以及表观改变而物理不变的配对干预,测两侧的响应幅度比
- agentic judge 的涨点要按 decisive 子集重新归一,否则分不清判别力与决断率——2608-HarnessEvalW 相对 WBench 在同视频同后端上把 Physical pairwise accuracy 从 31.9% 提到 71.7%,同时 draw 率从 52.2% 塌到 1.8%;按决断比例归一后判对率只从 66.7% 到 73.0%,Intentional 轴更是从 94.2% 降到 87.5%。四十个百分点的头条增益几乎全部买自”敢不敢下判断”,而判对的比例在一个轴上还退了。这一步反推只用到原文报告的 accuracy 与 draw 两个数,论文自身未作此分解。它对库内所有以 pairwise accuracy 为主指标的 judge 类工作都是直接可执行的核查动作
- 针对世界模型用途微调视频模型,会用意图跟随与物理合理性换记忆一致性——2608-HarnessEvalW 的两组底座对照同向:HY-WorldPlay 1.5 相对 HunyuanVideo 1.5 是 Revisit +8.4 / Intentional −24.2 / Physical −11.2,DreamX-World 相对 Wan 2.2 是 Exploratory +4.8、Revisit +7.8、Offscreen +3.5 而 Intentional −11.9、Physical −7.2。若这个交换普遍成立,那么路线 1 里一批专攻长时程 revisit 与寻址的改进(如 2608-WorldTrace)都需要补报意图与物理轴上的退化量,而目前没有一篇这样做。边界很硬:只有两组对照、每组一对模型,底座与微调数据均不公开,因果归因远未完成
- “表示选择”类论文系统性地用分析论证替代对照实验——2608-CodeAsWorld 用整节论证 code 优于 pixel / 3D / language 而全文无表示对照实验,2609-ProgrammableWM 的 Sec 2 是一整篇表示谱系论(text / 2D box / mask / OBB / G-buffer)而全文零 ablation。两篇互不相关、错法相同,原因结构性:对照实验要求把竞争表示各训一遍,成本高且结果未必有利。可直接执行的判据是先问”哪张表比较了表示”。这条同时约束本 survey 自己——路线 11 目前记录的是两篇的存在性与各自被验证的那个窄命题,不是”可执行程序是更好的世界表示”
Open Problems
- Action-following faithfulness:video WM 对错 action 也生成成功,policy 一定能找到 WM 盾区做 reward hacking。SANS 式 near-success 数据 + reward head 是初步答案,但是否 scale 到 long-horizon / multi-agent / deformable 尚未验证;2606-RehearseVLA 冻结 WM 且不处理该风险,2607-GigaWorld1 观察到 contact-sensitive failure 的 optimistic bias——同一问题在 evaluator 侧同样存在。2608-WorldSimProbe 把这个问题拆成两半并各给一个可测形状:动作是否被实现(六模型 fidelity 随 receiver–donor motion mismatch 下降,ρ=−0.433;不熟悉执行风格低 10.8–16.1 分),以及响应是否被已实现的 motion 支持(no-contact 场景下的幻觉接触)。由此浮出的真正 open question 是覆盖:训练分布 A_task 之外的可行动作空间没有任何一篇工作在系统性地填,而 near-success / 探索数据只在任务内加密
- Physics alignment 不随 scale 解决:Cosmos 7B vs 14B 在 rigid-body benchmark 上 IoU 基本不变;候选方向:(a) hybrid physics (Genesis/PhysGen);(b) RL on intuitive physics MCQ (Cosmos-Reason1)——但第二条只涨 VLM-level reasoning,不 carry over 到 video generation;(c) 离散符号中间表示 + reason-then-render(2607-PhiZero),生成端 Physics-IQ 41.2 领先,但缺同数据同算力、仅移除中间表示的对照,21.2→41.2 混淆表示/数据/训练三变量,且判别端未同步(IntPhys2 Hard 52.38)。三条候选都还没有把”物理”从”看起来像物理”里分离出来
- Long-horizon drift:所有 autoregressive video WM 超过训练 horizon 都退化——GameNGen 3 秒、DIAMOND frame-stacking、World-VLA-Loop 200 帧、OccSora 离开 32 帧 FID 飙 200+。Explicit compressed memory、retrieval-based context、LLM-style KV cache + streaming 都是候选,但没有任何一种在 robot-relevant setting 上 demonstrated;2607-AlayaWorld 的 error bank + 双记忆零定量评估,2607-Wonder 的 full-fidelity sparse KV 只固定 active attention 且长期一致性仍为 qualitative evidence。后续必须同时报告 quality/control/revisit metric、latency 与 total memory 随 horizon 的曲线。2608-WorldTrace 把静态场景 revisit 这一子问题从”容量不够”改判为”读不到”,并在 O(1) cache 预算下用 training-free 的位置重分配拿到 ABA PAC 0.864 对 0.723——但它明确把”该记住哪些位置”留空(Landmark 靠 cosine-spike 检出的 scene-entry 帧做启发式冻结),动态主体的 exit / re-entry 也不在其范围内。剩下的问题因此变成:写入策略能否学习,以及寻址修复在动态场景与更大模型上是否还成立
- Latent vs pixel 的路线之争:V-JEPA 2 给出 15× 计算优势 + success rate 反超 Cosmos;DreamZero 反过来用 14B pixel WAM 达到 62.2%。2607-PhiZero 提出第三种位置——在离散符号空间推理、再渲染回像素,兼取 latent 的低维推理与 pixel 的可视化输出,但它同时是这条路线最直接的警示:判别能力没有随生成能力一起上来(IntPhys2 Hard 52.38 落后于纯 latent 的 V-JEPA 57.42)。真正的 open question:long-term 哪一条路径 scale 更好?或三者按用途分工(cloud-side pixel WM 做 data engine,符号中间层做 planner,edge-side latent WM 做 on-device MPC)?
- Cross-embodiment transfer 真能靠 video 做到吗?:DreamZero 的 12 min 人类 egocentric / 20 min YAM robot video → unseen task +16pp 是至今最强信号;但 humanoid 五指手 vs bimanual gripper 级的 morphology gap 尚未被 video WM 路线 attack
- Benchmark metric 的 unresolved confound:video fidelity (FID/FVD) ↔ physical faithfulness (VBench-2.0, PhysBench) ↔ policy success (DreamGen Bench / LIBERO SR) 三者相关但不等价。系统化的”哪个 metric 评 WM 公平” 的框架尚未建立。2607-PhiZero 把 confound 收窄成一个可操作的判据:生成式(Physics-IQ)与判别式(IntPhys2 Hard)在同一模型上给出相反排序,因此 WM 论文至少应同时报告两类指标,并按材料/难度分层——聚合分会掩盖流体等薄弱项(LikePhys 刚体第一、流体倒数第三)。2608-WorldExam 给出两条方法层的部分答案:把”指令写明的”与”须自行推断的”分层报告,以及用两条 track 拒绝把”接口不支持”平均进总分;但它自己也承认 Task / General / Overall 都是跨异质指标(几何法 0–100 分与 checklist 满足比例)的算术平均,单个聚合分跨范式引用意义有限。一个不需复现即可做的收窄动作是把公开表里每个模型的 General 均值对其 Task 均值作回归,直接量化视觉质量对能力的解释力——原文只给了范围,未给相关系数。2608-WorldSimProbe 从下游一侧给出另一条收窄:用各 ACWM 的合成数据训 policy,standard 轨迹上成功率挤在 78–86% 无法区分模型,只有在 OOD 轨迹上才分离成 53/34/21% 并与诊断排序一致——“用下游成功率验收 WM”的做法只在评测控制分布本身足够宽时才有分辨力。同一篇的 evaluator 对照(RMFA ρ=0.750 vs VLM 0.450 vs IDM 0.284)把”用什么打分”也变成了可比较的选项。显式 3D 路线上这个 confound 尚未被触及:2606-PointWorld 的主指标是 1 秒 horizon 的逐点 ℓ2 flow 误差,几何精度到任务成功率的映射作者自陈未量化。2608-PAWBench 加进一个此前完全缺席的维度:上述所有指标都定义在单条 rollout 上,而多结局过程要求的是分布正确,两者可以同时成立也可以互相背离(一个模型可以 diverse 而不 aligned)。因此”哪个 metric 评 WM 公平”现在至少是三维的——单条保真、分层诊断、分布对齐——而没有任何一篇同时报告三者
- WM × VLA 耦合方式的 trade-off space:当前 7 种耦合方式都有代表工作(offline data engine / inference-time latent conditioning / joint model / RL simulator / evaluator / test-time planner / RL critic 辅助目标),但没有 head-to-head 比较。在同等 compute / data 预算下,哪种耦合方式对 sample efficiency 最敏感?新加入的 planner 分支还带一个专属问题:2607-WorldActionPlanner 显示 1 次想象胜过 BoN-8,但没有 imagination horizon 扫描,也没有测误差累积——想象的收益在多长 horizon 上翻转成 drift 的代价,目前无数据
- 开源 vs 工业化:可复现性断层:Cosmos 10 000 H100 × 3 个月、Motus 18 000 GPU-hours、DreamZero 2×GB200——任何”主脉络” WM 都远超学术实验室预算
- Agent memory 与 World Model 的边界:OpenWorldLib 把 long-term memory 写进 world model 定义,但 Memory 接口留空。2603-Memoir 用 imagination 作 retrieval query,2607-Wonder 用 query-summary 选 full-resolution historical KV,2607-ObjectCentricEnv 则把 object/procedure memory 直接做成 executable environment model;三者分别是“想象→检索”“生成→记忆”“记忆→模型”,尚无统一接口或同任务比较
- L3 Evolver 实现:当 prediction 失败时如何自主修正模型?
- World Model 的 failure mode 系统性分析:RAGEN-2 发现 template collapse,但其他 failure mode 未知
- Deterministic vs Probabilistic 的 trade-off:DGE 适用边界如何扩展?
- World Model for GUI Agent 的 grounding 问题:如何与 grounding robustness 结合?
- Progress token 作为 L3 Evolver 信号:能否用于自主修正触发?
- Plan locality 的适用边界:是否适用于所有 embodied tasks?
- WAM 的 scaling laws 未知:DreamGen 展示 log-linear scaling 趋势,但 Motus/DreamZero 的 scaling behavior 未被系统研究;video vs action 之间的 optimal compute allocation 无结论——这决定 WAM 范式是否值得学术实验室以外的算力投入(参见 Open Problem 8 可复现性断层)。
- WAM 的 action–imagination 同步性:2607-BadWAM 证明两条 pathway 可被有界视觉扰动解耦,简单 augmentation-consistency detector 召回仅 13–21%;action-conditioned consistency verifier / 可执行 inverse-dynamics check 是候选方向,但无实现
- Explicit state 如何驱动生成:2607-PixelsToStates 指出 accumulated-condition outcome、out-of-view consequence persistence、rule-defined consequence timing 三类缺失都指向被隐式化的 game state。2609-ProgrammableWM 给出第一个闭环实现——引擎维护 canonical state、确定性 compiler 把 3D OBB 投影成 pixel-aligned 控制图、冻结视频模型只负责渲染——但它把留白往前推了一格而没有填上:被定量评测的状态属性只有”可见存活角色数”与”死亡是否被画出”两条,而 PixelsToStates 点名的三类缺失(累积条件、出画后果持久、规则定义的 consequence latency)以及 inventory / task progress / faction 一个都没进评测。真正的 open question 因此变成:如何验收一个显式状态被正确渲染,当该状态的大部分在当前画面里根本不可见时。迁移到真实世界还需 state estimator
- Digital WM 的转移幻觉与 reward 审计:2511-DreamGym 的经验模型既当转移函数又当 reward 函数、无外部审计;2510-RWoM 的 tutorial grounding 只把 compounding error 推迟到 horizon≈3,2607-ObjectCentricEnv 的 re-execution 只保证 runnable consistency。“合成转移 + 真实 verifier”的混合方案是否优于两个纯路线未验证。2608-EnvACE 把缺口推到更尖锐的形态:连”转移函数”都收进 policy 权重后,保真度彻底不可审计(无任何 对真实响应的对账),且 reward 通道仍依赖外部 LLM judge——“训练期零环境交互”只对 transition 通道成立;2608-AppDeltaWorld 的 transition index 是结构侧的部分解(非法转移可查表拒绝),但其 consensus-reward 负结果说明状态等价判定仍缺
- Environment quality 的非 correctness 维度如何操作化:2606-EnvEngineeringSurvey 明确指出 diversity、complexity、fidelity under-researched;需要把这些维度变成可重复测量,并与 agent learning progress、reward hacking 与 sim-to-real error 建立因果而非相关关系
- 扩展”被预测的未来”,边际收益到底来自哪里:2607-STWAM 与 2607-N0TWAM 各加了一条新的未来预测通道(语义 / 触觉),两篇的消融却都显示新增的预测通路不是主要收益来源;N0-TWAM 从未做”去掉 future-vision 预测”的消融,也无”两条触觉通路同时关闭”的联合对照,ST-WAM 则无参数量、主表 baseline 来源不明。需要的是在同一 backbone、同一数据与算力下逐条移除预测目标的 matched 对照,否则这条路线的收益无法与规模、额外参数与冻结 encoder 的先验分离。这类对照已开始出现零散样本——2608-SimWAM 的 mask 拓扑消融、2608-WorldTokens 的 bypass 与 anchor 消融、2608-JEPAWAM 的 target/readout 逐项对照各自隔离了一个耦合变量——但仍没有一篇在同一 backbone 上同时覆盖”预测什么、经什么接口耦合、给多少容量”三个轴
- 表示的”不变性 × 可分性”在何种偏移下同时成立:2607-STWAM 依赖 DINOv3 对外观扰动的不变性,而其评测的偏移恰好全是外观级;2607-N0TWAM 的 NeoForce 只在其预训练传感器(InTac S1)上验证,仿真因传感器不匹配直接放弃 force space。换成物理动力学、embodiment 或传感器型号级别的偏移时,什么表示能同时做到”对无关扰动不变”与”对任务状态可分”,两篇都把它列为 future work
- 心理 / 社会状态的 world model 缺过程级验收:2607-MentalWorldModeling 定义了 mental fidelity、perspective-leakage rate、process-outcome divergence 却一个数值都没报,benchmark 与被测 pipeline 共享 schema、gold 由同一批作者裁定为唯一可辩护最优(真正有多个可辩护答案的社会决策因此被系统性排除)。要让 Social 约束域从 position 变成技术路线,缺的是 learned transition、心理变量的不确定性表示,以及过程级保真度的独立测量
- 接口属性与模型档次如何拆开:2608-WorldExam 的核心结论”能力沿控制接口分裂且互补”建立在 dynamic track 的 9 个模型上,其中 action-driven 只有 2 个本地部署模型、language-driven 7 个全部走 API,论文亦承认闭源系统的 proprietary prompt enhancement 可能参与场景 grounding 与执行规划。判定这是接口的属性还是模型档次的属性,需要同一生成底座分别接动作接口与语言接口的 matched 对照,目前无人做。这也意味着”三种接口能力互补”的保质期可能很短——一旦强动作接口接到强生成底座上,整张表就会重画
- checklist 作为 ground truth 缺独立审计:reactivity 类任务的判定链条是”LLM 起草 checklist → VLM judge 按 checklist 打分”,2608-WorldExam 的 human alignment(Spearman 0.8614 / PLCC 0.8583,800 实例 / 5,793 item)验证的只是链条后半段;checklist 本身是否抓对了该发生的物理与社会反应无人验证,人工介入只在候选初始图筛选。judge 只看均匀采样的 10 帧,而 timely adjustment、premature onset、freezing 这类判定恰恰依赖帧序,Social Interaction 的一致性也正好最低(0.7019),10 这个数无敏感性分析。与 2607-GigaWorld1 的 WMES(与人 Spearman 0.7574)合看,VLM judge 与人的一致性目前落在 0.75–0.86 这个带子里,可作为后续报告的参照带;但一致性带子解决不了”评分标准本身对不对”。另有一条未被任何一方测过的旁路:judge 把”无法核实”记为不满足时,画面质量可能从后门渗进 reactivity 分数(推测,两篇均无相关分析)。2608-WorldSimProbe 的对照给这条带子加了一个前提:它测到 VLM 对 91.7% 的 rollout 判 positive action following 而人类只判 42.2%,一致率 0.450。这与上面 0.75–0.86 的带子不冲突——差别在判定形式,checklist 分项打分与”整体跟住了吗”的二元判断不是同一个任务,而后者在 OOD 控制上系统性偏乐观。可操作的推论是:VLM judge 应限定在有明确 checklist 的分项判定上使用,且须报告判定的控制分布
- 契约式诊断能否推广出仿真:2608-WorldSimProbe 的可诊断性依赖 simulator——每个反事实都要能被真实执行以提供 reference,manifest 才能在推理前冻结。这一条件在真机上不成立,而其全部结论也都在仿真内、单一外部视角、模型均为 in-domain fine-tune。三个方向各缺答案:通用 pretrain ACWM 在同协议下的 zero-shot fidelity(作者未测);真机 rollout 上如何构造无需完美 reference 的反事实;以及契约的两个条件在长 horizon 闭环、deformable 与多物体交互上是否还能分开测量
- state-conditioned 的分布重塑还没有对应的训练目标:2608-PAWBench 把这个空格定位得很干净——语言侧控制只能选分布(而 VLM 自己的 outcome 分布 TVD 就有 34.8–42.3),噪声侧耦合只能在既有分布内采样得更充分,训练侧改数据比例是全局的、无法按物理状态自适应。缺的是一个以 per-state 分布匹配为优化目标的 post-training objective,以及与之配套的、不依赖 VLM judge 的分布读出方式。两个前置问题同样未解:参考分布只在有对称性或解析解的场景上拿得到,真实场景的 ground-truth 分布从哪来;以及分布对齐要到什么精度才对下游 planning 有增量价值——目前没有任何一篇把 TVD 连到决策收益上
- 评测器自身的可信度用什么验收:诊断式评测已经有四条切法,但每一条都默认自己的打分器可信。2608-HarnessEvalW 第一次把评测器做成可审计的 agent(逐 case 路由、证据树、跳过理由),却留下三处关键缺口:没有实验把”分解成子技能”与”rubric 更细”分开,路由与分解的错误率从未被测量,证据树的忠实性从未被验证;加上未报告标注人数与 inter-annotator agreement,人类天花板未知,ρ=0.93 无从对照。更结构性的问题是这条路线的纪律并非单调前进——它的 Overall 是非加权算术平均,把”接口不支持”重新记成了”做得差”,而 2608-WorldExam 已用两条 track 拒绝过这条口径。需要的是把”评测器好不好”变成一组可复用的验收项:决断率与判对率分开报、接口可支持性显式建模、分解链路的错误率可测
- 可执行程序路线缺的是覆盖面数字与表示对照:两个问题各自具体。覆盖面上,2608-CodeAsWorld 的 video-driven 侧靠三个感知模型加至多五轮验证从 WISA-80K 反解世界,而过滤留存率全程未报告——“离开被筛出来的那类场景还剩多少”是与 video WM 对比时最该给却没给的数字;2609-ProgrammableWM 的 coding agent 生成正确率同样零评测。表示对照上,两篇都以整节论证表示优劣而都无对照实验,最便宜的一档是 PWM 自己的 direction map——训练态来自检测器估计的位移、推理态来自引擎解析 velocity,两者的分布差异可直接算,正是其 training–inference asymmetry 论证的现成测试台。第三个问题在”规则由谁执行”这条轴:StatePlay(模型预测状态)、MASS(learned Logic Engine)、PWM(手写规则)三点对转移误差如何被吸收给出完全不同的答案,而三者从未同台比较
调研日志
-
2026-09-18 survey-refresh:并入 23 篇(2608-DreamXPhi / 2608-AlayaEvoke / 2608-HarnessEvalW / 2608-DALeWM / 2608-Hydra0 / 2608-RLHEV / 2608-PAWBench / 2608-GameWAM / 2608-ZeroWAM / 2608-Zeva / 2608-CAER / 2512-NavForesee / 2609-DiscriminativeWM / 2609-H3World / 2608-ZimaBlue / 2609-SparseResidualWM / 2609-SolarWM / 2608-CodeAsWorld / 2606-GRWM / 2608-WMRL / 2609-ProgrammableWM / 2609-OpenWAM / 2609-DreamRSI),skip 2 篇:2609-ZETA(受控 cross-embodiment VLA 迁移研究,无世界模型或未来预测组件,经
cross-embodiment关键词误路由,归属 VLA-Survey)、2609-ShowHarness(VLM agent + 语义离散动作单元 + 确定性解释器的机器人控制 harness,把 VLA 与世界模型一并移除而非使用,其可迁移结论是动作接口设计而非世界建模)。结构性变化:新增路线 11 可执行程序作为世界表示(CodeAsWorld 反解 + ProgrammableWM 驱动,含两篇分工对照表与 training–inference asymmetry 论证);路线 10 从两条切法扩到四条,新增 10c(按结局分布拆,PAWBench 的 support / probability-mass 双层与 Monte Carlo 排除性论证)与 10d(按评测流程拆,HarnessEval-W 的 agentic harness 与决断率归一重读);路线 1 补动作接口设计轴分支与长时程可玩性验收缺口;路线 2 / 3 / 4 / 5 / 6 / 7 各补代表工作与分支(详见正文)。最重要的一处是把 Takeaway 33 从共识降级为按任务域分裂的争议:2609-OpenWAM 在 RoboTwin2.0 上用同类底座跑同一组 mask 对照,方向与 2608-SimWAM 相反(切断 world→action 通路掉约 5 pp 对 0.1–0.2 pp 无差别)。Overview 趋势 +23–28;Key Takeaways 更新 33、新增 39–43;Open Problems 更新 6 / 18、新增 27–29;Benchmarks 表 +4 行(PAWBench / HarnessEval-W / QuantiPhy / CombatStateBench);路线对比表 +1 行(可执行程序 WM)并更新 pixel 行与 digital 行。未刷新配图(本 survey 无配图)。- papers_analyzed 口径对账:按”正文(
## 调研日志之前)中能解析到真实Papers/*.md的唯一 wikilink”机械重数得 96。HEAD 版本按同一口径机械重数为 73,而其 frontmatter 记的是 63——差值 10 属历史漂移(旧值为逐轮加总而非机械复核)。本轮采用机械值,链条为 63(旧记录)→ 73(HEAD 机械值)→ 96(本轮机械值)。 - 证据边界:PAWBench 的判定链依赖 Gemini 3.5 Flash,而该 judge 正属其自己证明分布失准的 VLM 族;81.3% 人类一致率只在 888/1,500 明确子集上成立;Coverage / TVD 均值只在过 readout gate 的场景上计算,SPR 差异大时跨模型不可比;只比较 terminal outcome,Calibration 参考分布依赖对称性假设。HarnessEval-W 全部 21 条 ledger 为 source-verified,但人类对照只覆盖 8 个 setting 中的 2 个、18 个模型中的 9 个,未报标注人数与 IAA;无分解/rubric 分离消融,路由错误率与证据树忠实性均未测;“换不同 VLM 稳健”实为同一 GPT-5.5 在 temperature 0 重跑三次;无 Limitations 节;本 survey 对其”增益买自决断率”的分解是按原文 accuracy 与 draw 两数反推,论文自身未作此分解,须按推算引用。CodeAsWorld 的 QuantiPhy 仅 159 题、领先 0.6 分、无误差棒,27B 为 step-60 单次采样;discovery loop 的收益从未连到下游分数;主文 discovery 分析用的是 animation engine 而非 physics engine;discovery agent 的 LLM 与 VL backbone 均未公开。ProgrammableWM 全文零 ablation、无 implementation details 与 limitations 节,主表的 dense 条件图已携带答案因而不测 programmability,缺自家 v1 底座的对照行,judge Qwen3.6-27B 无引用无校验,benchmark 与训练集共用同一 Data Engine;其 897 帧长序列只有定性描述,项目页的 “no drift” 措辞强于论文,正文以论文措辞为准。OpenWAM 的 mask 反转结论建在 +0.16 / +0.70 / +0.72 pp 三个单次运行差上,全文无 dispersion 估计,正文已按”多 seed 重测后方向可能不稳定”标为可证伪假设。以上均为库内单篇证据,无独立复现;PAWBench 与 WorldSimProbe 在”表观相关压过物理转移”上的同向属跨论文 pattern,非复现。
- papers_analyzed 口径对账:按”正文(
-
2026-09-07 survey-refresh:并入 7 篇(2608-WorldSimProbe / 2608-WorldTrace / 2606-PointWorld / 2608-LatentTo4D / 2607-ABotWorld0 / 2608-CombodiedAgents / 2608-StellaVLA),skip 1 篇(2608-GalaxeaG05,AR-VLA 架构论文、无世界建模或未来预测组件)。结构性变化:路线 10 从单一小节改为两条并列的拆分轴(10a 按后果来源 / 10b 按因果链环节),后者写入 Observable Simulator Contract 与五个 probe suite 的三层读数;路线 1 新增「长时程失败先是寻址问题,再才是容量问题」分支(WorldTrace 的 RoPE offset 越界机制 + canonical key 压缩 + 两种写入器),代表工作补 ABot-World-0;路线 3 由纯扩散改写为「场景合成」与「action-conditioned 3D dynamics」两支,分别补 Latent-to-4D 与 PointWorld;路线 4 的「训练期消费、部署期丢弃」分支加两条限定(StellaVLA 作为出族拓扑实例 + LIBERO-Plus 跨论文名次不可替代同 backbone 消融);路线 5 / 6 缺点与 gap 更新。最重要的一处是把 Takeaway 32 从”两条证据收敛”降级为争议:WorldSimProbe 的幻觉接触与 WorldExam 的漏掉接触方向相反,构造也相反,不可算作两票。Overview 趋势 +20/21/22;Key Takeaways 更新 20/21/32/33、新增 35–38;Open Problems 更新 1/3/6/25、新增 26;Benchmarks 表 +5 行(WorldSimProbe / LoopBench / WorldRoamBench / PointWorld 数据集 / Text4D-200-I4D-200)并更新 LIBERO-Plus 行;路线对比表 pixel 行与 3D/4D 行改写。未刷新配图(本 survey 无配图)。
- 证据边界:WorldSimProbe 全部在仿真内、单一外部视角、六模型均为 in-domain fine-tune,ρ=−0.433 与 late/early 10.8–16.1 只在 RoboTwin 上报告,downstream 仅一个 RoboTwin task(作者自称受控 case study),T5 的 primitive 判定仍由 VLM judge 给出(reference set 一致率 94–97%)。WorldTrace 主结果只在单个 1.3B 游戏 world model 上,LingBot-World 仅附录级且 Field 在其上几乎无增益、2× horizon 无显著增益;LoopBench 由同一团队提出、PAC 基于 CLIP 相似度,同一 ABA 配置跨表绝对值差异大(0.723 / 0.540 / 0.837)不可混用。ABot-World-0 为 partial 核查,只引 source-verified 行;其 WorldRoamBench 结果须按”作者与 Benchmark Team 高度重叠”读,LingBot-World / HY-World 1.5 的异常低分未获解释,评测所用量化配置未披露因此拿不到速度-质量曲线,机构归属在笔记中状态为 unsupported、正文未断言。PointWorld 的主指标是 1 秒 horizon 逐点 ℓ2 flow 误差而非任务成功率,真机成功率方差极大且需人工指定 task point,开源为截稿时的未来式承诺。Latent-to-4D 的 DINO-F1 是 appearance-dependent proxy、作者明确其不建立 metric 4D accuracy,全部证据在单一 Wan VAE family 内。CombodiedAgents 零实验零数据零代码,其 12 类分类学为作者自建先验、含 strawman 成分,只用于存在性与定位。StellaVLA 仅作 LIBERO-Plus 上的非世界建模对照与拓扑外延实例,不作为世界建模证据。以上均为库内单篇证据,无独立复现。
-
2026-08-11 survey-refresh:并入 8 篇(2608-SimWAM / 2608-JEPAWAM / 2608-WorldTokens / 2608-MobileWAM / 2608-AppDeltaWorld / 2608-EnvACE / 2608-DreamGuard / 2608-WorldProxy;前七篇 source-checked 或 partial 均按 ledger 限权引用,WorldProxy 为 position paper、partial 核查)。结构性变化:路线 4 新增「训练期消费、部署期丢弃」分支——SimWAM / JEPA-WAM / WorldTokens / MobileWAM 四篇与既有 ST-WAM 收敛成 WAM 子族,三组独立消融(mask 拓扑 / Full-hidden / bypass)给出耦合拓扑的机制解释;路线 7 补 AppDeltaWorld(transition-grounded 结构解 + 状态等价判定缺失)、EnvACE(内化极端形态 + 归因对卖点不利)、DreamGuard(RSSM guard 的延迟/可读性/跨分布权衡曲面)三段;路线 9 补 WorldProxy 并在 Overview 加 L1/L2/L3 术语注记(Chu 能力刻度 vs Proxy 介入深度)。Overview 趋势 +18/19;Key Takeaways +33/34;Open Problems 19/21 更新;Benchmarks 表 LIBERO-Plus 行更新;路线对比表 Unified VLA+WM 行扩展。未刷新配图(本 survey 无配图;新分支为路线内分支、分类框架未重构)。剩余 pending 2 篇(WorldSimProbe / WorldTrace)留下一轮。
- 证据边界:SimWAM 的 mask 消融差距 0.2 在噪声量级内,结论限”可丢弃性零代价”;其延迟对比无基线数字、RL 增益与评测指标同族。JEPA-WAM code 未发布、affiliation 匿名化残留、baseline 为同期工作可比性未核对,增益集中在 Camera 扰动列。WorldTokens 的 “best reported on SIMPLER” 仅相对表内 baseline,LIBERO 非最优,无代码无超参 sweep。MobileWAM 真机 trial 数未报告、评测在训练分布内、Table 3–6 参照配置身份不明。AppDeltaWorld(partial)只引 source-verified 行,机构不可解析。EnvACE 的 “训练期零环境交互” 只对 transition 通道成立(静态参考数据 + 外部 judge),TTS 为单次 run。DreamGuard 只在 SafetyDrift 训练标定,跨分布 PHIR 崩塌为其自报数字。WorldProxy 零实验零检索协议,其 I-JEPA/V-JEPA 2 归类错误已在正文标注不得转录。以上均库内单篇证据、无独立复现;“训练信号收敛”为跨论文 pattern 而非复现。
-
2026-08-05 survey-refresh:并入 1 篇(2608-WorldExam,full-text + source-checked,Evidence Ledger 23 行全为 source-verified)。结构性变化:新增路线 10「诊断式评测:把”指令写明的后果”与”须自行推断的后果”分开」——survey 此前只有 Open Problem 6 承载评测方法论、无对应正文小节,这一篇给了它锚点。路线 1 的缺点表新增”控制被执行但世界不回应”作为与 action-following 相互独立的失效面;路线 6 的 optimistic bias gap 补入方向一致的生成侧读数;路线对比表 pixel 行的 open gap 加入 world reactivity。Overview 趋势 +17;Key Takeaways +31/32,Takeaway 24 由单篇(Phi-Zero)扩为三个角度的同向证据;Open Problem 6 更新并新增 24/25;Benchmarks 表 +WorldExam。未刷新配图(本 survey 无配图,本轮为新增小节而非分类框架重构)。
- 证据边界:接口范式与模型档次共线是这篇最主要的问题——dynamic track 上 action-driven 仅 2 个本地模型对 language-driven 7 个 API 系统,“action 接口 → 世界不反应”与”这两个特定模型 → 世界不反应”在其数据里分不开,论文未将此列为 limitation。范式内方差大于范式间(Kling 2.5 的 Task 39.85 低于 LingBot-World 39.91,范式内跨度 25 分),“language-driven 更会反应”实由三个最强系统撑起。四个 checklist 任务的 ground truth 由未具名 LLM 起草、refiner 改写后定稿,人工只筛初始图;human alignment 验证的是 judge 而非 checklist。judge 只看 10 帧且无敏感性分析。六个动态任务初始图全为合成、生成模型与候选数未披露,与 static track 输入不同源;每 case 只跑一次生成。“20 个模型”仅指 static track,reactivity 层实际 9 个。数据与 toolkit 尚未发布。以上均为库内单篇证据,无独立复现;与 2607-GigaWorld1 在 contact 失效点上的收敛属跨论文 pattern,非复现。
-
2026-08-04 survey-refresh:并入 5 篇(2607-QQWorld / 2607-STWAM / 2607-WCM / 2607-MentalWorldModeling / 2607-N0TWAM,均 full-text;ST-WAM 为 partial 核查,其余 source-checked)。结构性变化:路线 4 新增”被预测的未来该是什么表示”分支(ST-WAM 双空间未来 + N0-TWAM 触觉未来),路线 5 新增 critic 侧分支 WM-as-Critic 并在路线对比表 +1 行、Unified VLA+WM 行补 2 篇代表工作;路线 2 补 QQ-World,路线 9 补 MWM(Levels × Laws 中 Social 约束域的首篇)。Overview 趋势 +14/15/16;Key Takeaways +26–30,Takeaway 12 由六种耦合改为七种(新增 critic 侧,2607-WCM);Open Problems 更新 7、新增 21–23;Benchmarks 表 +LIBERO-Plus / UniVTAC / Menti-Bench 三行。未刷新配图(本轮为分支新增,分类框架未重构)。
- 证据边界:ST-WAM 的核心机制断言(pixel-generative 未来监督造成 entanglement)在笔记 Evidence Ledger 中状态为
unsupported,全文无任何 entanglement 度量,本轮只引用其消融数字与负结果;其 LIBERO / RoboTwin 表未交代 baseline 来源、全文无参数量,唯一同示教同流程的干净对照是真机组。N0-TWAM 的 NeoData / NeoSim / NeoReal / NeoForce 均出自同一份公司网页报告,规模数字一手出处不可独立核查;真机每任务 20 trials,二项标准误约 ±11%,逐任务存在方向反转。WCM 全文无 value-accuracy 指标,“预测目标 → 值估计更准 → 策略更好”只有两端被测;SIGReg 在 on-policy 下关闭,仿真结果实际只有 生效。MWM 只报 final-action F1,其自定义的过程级指标全部无数值,benchmark 与被测 pipeline schema 同源。QQ-World 只在单一 LeWM backbone 上验证,Reacher / OGBench 增益落在标准差内,三条 proposition 未给证明。以上均为库内单篇证据,无独立复现。
- 证据边界:ST-WAM 的核心机制断言(pixel-generative 未来监督造成 entanglement)在笔记 Evidence Ledger 中状态为
-
2026-08-02 survey-refresh:并入 2 篇(2607-PhiZero / 2607-WorldActionPlanner,均 full-text + source-checked)。结构性变化:路线 1 新增 reason-then-render 分支(离散”物理语言”中间表示 + 扩散渲染),路线 5 新增推理期 WM-as-Planner 分支并在路线对比表 +1 行;Overview 趋势 +12/13;Key Takeaways +24(生成保真不蕴含物理判别,把 Takeaway 16 从 evaluator 场景推广为一般性质)、+25(推理期规划);Takeaway 12 由五种耦合改为六种;Open Problems 2/4/6/7 更新;Benchmarks 表 +Physics-IQ / IntPhys2 / LikePhys-WorldModelBench 三行。未刷新配图。
- 证据边界:Phi-Zero 缺同数据同算力、仅移除中间表示的对照,21.2→41.2 的增益混淆表示/数据/训练;其 “zero-shot” 迁移仍需按源域微调 tokenizer,无代码发布。WAP 全仿真无真机,使用 URDF、相机标定与硬编码抓放原语,“72 vs 0” 不可读作 world model 单独贡献(仅 Table 9 隔离);+11.4%/+16.8% 为 PSNR 与 LPIPS 相对提升再平均,论文自承构造可疑。
-
2026-07-29 survey-refresh:并入 4 篇(2510-RWoM / 2607-ObjectCentricEnv / 2606-EnvEngineeringSurvey / 2607-Wonder)。路线 1 新增 camera-controllable video WM 的 control–memory–distillation co-design 与严格证据边界;路线 7 补 external-tutorial grounding 与 executable object/procedure model;路线 9 引入 environment lifecycle 视角;Benchmark +1,Key Takeaways +21–23,Open Problems 更新 3/9/19 并新增 20。无新平行 taxonomy,未刷新配图。
-
2026-07-21 survey-refresh:并入 17 篇(WebDreamer / DreamGym / RynnWorld-Teleop / WAC / UI-Simulator / WebSynthesis / RynnWorld-4D / AlayaWorld / Memoir / FlowWAM / RehearseVLA / SeerGuard / ABot-M0.5 / BadWAM / Orca / GigaWorld-1 / PixelsToStates),skip 3 篇非 WM(LaMem-VLA / DART / Xiaomi-Robotics-1)。结构性变化:路线 6 更名 WM-as-Policy-Evaluator 并以 GigaWorld-1 为旗舰;路线 7 扩为 Digital-Domain World Model(Web/GUI)五用途表;路线对比表 +2 行;Key Takeaways +16–20;Open Problems +17–19。
-
2026-07-20 合并 WorldActionModel-Survey(Supervisor 指示同方向 survey 整合):该 survey 的 8 篇论文(DreamZero/UWM/Motus/DreamGen/World-VLA-Loop/IRASim/Cosmos/RWM)本已全部覆盖于路线 1/2/4/5,属完全子集。本次仅并入其独有内容:路线 4 标题补 WAM 命名与 “world models are implicit policies” 范式定义、action-free video data 优势论证;Benchmark 表 +Push-T/DreamGen Bench/TokenBench;Open Problem +16(WAM scaling laws)。原文见 git history。
-
调研日期: 2026-04-28
-
论文统计: vault 已有 4 篇(Archive)+ 2 篇(Papers)+ 新创建 6 篇 + 补充 4 篇(World-R1, dWorldEval, EmotionPose, AgenticCache)+ VLA 相关 3 篇(M²-VLA, Tube Diffusion Policy, CF-VLA)= 19 篇
-
未能获取: 无(基于已有月度总结和 candidates.json 创建笔记)
-
MindFlow 合并: 2026-04-30,从 MindFlow repo 合并 WorldModel-Survey,新增 5 条技术路线(Pixel video diffusion / Latent JEPA / 3D-4D generative / Unified VLA+WM / WM-as-RL-simulator)、6 条 Key Takeaways、7 条 Open Problems、路线对比小结表