跳转至

CD-LAM: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

论文阅读笔记 — 用于后续讨论的概览


CD-LAM overview Figure 1:(a)(b)(c) 三个 headline 数字(FDCE −34.8%/−30.4%、PSNR +0.75/+1.0 dB、步数 50k→3k/6k)。注意 (c) 的对比口径——CD-LAM 的 3k/6k 是「aligned protocol」下的步数,而 50k 是 DreamDojo 原始完整预算,两者并不在同一协议下,详见 §5.2 第 2 条。(d) 是全文的因果叙事:reconstruction-only 的 LAM 会把 confound 从紫色路径漏进 action condition,CD-LAM 把它掐掉。


1. 基础信息

  • 题目: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
  • 作者: Yufan Wei¹²*, Kun Zhou¹†, Lingjun Mao¹²*, Zijun Zhang¹, Ziming Xu¹, Ziqiao Xi¹, Shuang Liang¹²*, Ruobing Han¹, Yuchen Yan¹, Xinyue Wang¹²*, Fan Feng¹, Biwei Huang¹
  • ¹ Aether AI ² University of California, San Diego
  • * 实习期间完成 † Project Lead & 通讯 franciskunzhou@gmail.com
  • 末作 Biwei Huang 是 UCSD 做因果发现/因果表征的研究者,这解释了全文的 causal framing
  • arXiv 编号: 2607.09185(2026-07 提交,IEEEtran conference 模板)
  • 资源: Code · Project Page · Model
  • 关键词: latent action models, action-conditioned world models, causal debiasing, controllability, FDCE, DreamDojo

2. 文章介绍

2.1 解决的领域和问题

Action-conditioned world model (ACWM) 想做的事是:给定当前观测 \(o_{\le t}\) 和一段动作序列 \(u_{t:t+H-1}\),预测未来观测 \(o_{t+1:t+H}\)——本质是一个可以用动作「操纵」的视频生成器,用来做 planning、policy evaluation、data augmentation。

瓶颈很直白:训练可控的 ACWM 需要带动作标注的大规模数据,但真机数据贵。人类视频(Ego4D / EgoExo4D / EgoDex)便宜且量大,却没有可执行动作标签。Latent Action Model (LAM) 是这条路上的标准桥梁:从相邻帧 \(\langle o_t, o_{t+1}\rangle\) 推断一个 latent action \(z_t \in \mathbb{R}^d\),用它当 proxy action 去预训练 ACWM,最后再把真实机器人动作对齐到同一个 latent 空间(AdaWorld、DreamDojo 就是这个配方)。

本文要打的靶子是:这个 \(z_t\) 是用重建损失训出来的,而重建损失根本不管 \(z_t\) 里装的是不是「动作」。

2.2 Motivation

核心论断用一个式子概括:

\[z_t = \mu_\phi(o_t, o_{t+1}) \approx f(A_t,\; C_t,\; V_t)\]

其中 \(A_t\) 是 embodiment 动作效应,\(C_t\) 是场景 context,\(V_t\) 是 source-side 视觉因素(背景延续、外观连续性)。重建目标只要求 predictive sufficiency——只要能帮着预测 \(o_{t+1}\),任何因素都可以进 \(z_t\)

问题在于角色切换:LAM 训练时 \(z_t\) 是「转移的摘要」,ACWM 部署时 \(z_t\) 却被当作「可干预的控制信号」。一旦 \(C_t, V_t\) 混进去,条件就不再只指定 embodiment dynamics,而是部分指定了「视频该怎么往下续」。到了 Stage 3,真实机器人动作 \(u_t\) 能对齐 \(A_t\),但根本无法指定背景延续或相机残差——于是 \(u_t\) 被强行对齐到一个部分不可执行的 latent 空间,结果就是 action following 很弱。

论文管这个叫 action-irrelevant confounding

Zero action still produces motion Figure 0:motivating failure。2B DreamDojo ACWM 在 AgiBot 上完成 robot action adaptation 之后,固定初始帧、把所有相对机器人动作全部置零,rollout 依然在动。这就是「动作条件没有锚住 embodiment」最直观的证据,也是全文的出发点。

2.3 之前工作的问题

类别 代表工作 缺陷
离散 latent action Genie, LAPA, LAPO codebook 量化 inter-frame 变化,目标仍是重建;靠 scale 数据和 codebook 大小
连续 latent action + WM AdaWorld, DreamDojo 把 latent action 当作可迁移 condition,但 LAM 本身仍是 reconstruction-only;本文的直接 baseline
运动 tokenize 变体 Moto, IGOR 同样 associative,把 inter-frame motion / image-goal change 编码进共享空间
已经指出 LAM 有问题的工作 What Do LAMs Actually Learn? (NeurIPS'25), Latent Action Learning Requires Supervision in the Presence of Distractors (ICML), ConLA 诊断出了 distractor 问题,但没给出针对 ACWM controllability 的系统修复
视频世界模型评测 PSNR / FVD 奖励「像」而不奖励「听话」——模型可以照抄 context 拿高分却完全无视 action condition
运动跟随评测 MotionPro (ObjMC) 有 tracking-based 思路,但不针对 embodied manipulation 的前景
因果去偏 IRM, shortcut learning, causal confusion in IL 去偏的是输入;本文去偏的是条件变量(downstream 当作干预 handle 的那个量)

2.4 论文解决方案(一句话)

不改 ACWM 架构、不改 conditioning 格式,只在 LAM 上加三个 fine-tuning 目标(前景加权重建 + 动词标签对比学习 + free-bits KL 与零转移锚定),把 latent action 空间里的 action-irrelevant 成分洗掉,再让下游 ACWM 和机器人动作 bridge 继承这个干净空间。

2.5 与前序工作的关系

DreamDojo(Shenyuan Gao 等,A Generalist Robot World Model from Large-Scale Human Videos)是唯一的 baseline,也是整个 pipeline 的宿主——CD-LAM 复用它的 LAM checkpoint(~709.8M 参数,latent 维度 32)、它的 2B / 14B ACWM backbone、它的 conditioning 格式。同一位 Shenyuan Gao 也是 AdaWorld 的一作,所以本文实际是在 AdaWorld → DreamDojo 这条线上做外科手术。

CD-LAM 额外引入了 baseline 没有的两种监督:SAM3 前景 mask、以及从 caption 动词聚类出的 12 类粗动作 primitive 标签。这一点论文在 Setup 里明说了,但没有做对应的控制实验(详见 §5.2)。


3. 方法介绍

CD-LAM architecture Figure 2:左侧是被改造的 LAM(encoder → 32 维 latent → decoder)。底部蓝框是 Stage 1 的三个目标:embodiment-centric reconstruction(前景/背景差异化加权)、action-centric contrastive(同 primitive 拉近、异 primitive 推开)、latent space calibration(重复帧对映射到零点附近)。右侧 ②③ 是 Stage 2(用 debiased latent 继续训 ACWM)和 Stage 3(一个 Bridge 把可执行机器人动作映射进同一空间)。注意整条链路上 ACWM 的 conditioning 接口从未改变——这是这篇方法「可插拔」的关键。

3.1 形式化

LAM 写成 encoder-decoder:

\[z_t \sim q_\phi(z\mid o_t,o_{t+1}), \qquad \hat o_{t+1} = D_\psi(o_t, z_t)\]

标准目标只有重建 + 一个容量正则:\(\mathcal L_{\mathrm{LAM}} = \mathbb E[\ell(D_\psi(o_t,z_t), o_{t+1})] + \mathrm{Reg}(z_t)\)

ACWM 在 latent 阶段的条件分布是 \(p_\theta(o_{t+1:t+H}\mid o_{\le t}, z_{t:t+H-1})\)

CD-LAM 的总目标:

\[\mathcal L_{\mathrm{CD}} = \mathcal L_{\mathrm{emb}} + \lambda_{\mathrm{ctr}}(k)\,\mathcal L_{\mathrm{ctr}} + \lambda_{\mathrm{cal}}\,\mathcal L_{\mathrm{cal}}\]

\(\lambda_{\mathrm{ctr}}\) 随训练步 \(k\) 变化;\(t\) 保留给帧时间。)

3.2 Embodiment-centric Reconstruction

SAM3 拿到 embodiment-object 前景 mask \(M_t\in[0,1]^{h\times w}\),构造空间权重

\[W_t = \alpha_{\mathrm{fg}} M_t + \alpha_{\mathrm{bg}}(1-M_t), \qquad \alpha_{\mathrm{fg}} > \alpha_{\mathrm{bg}}\]
\[\mathcal L_{\mathrm{emb}} = \frac{1}{|\Omega|}\left\| W_t^{1/2}\odot(\hat o_{t+1}-o_{t+1})\right\|_2^2\]

背景权重保持非零以维持全局视觉一致性。思路是:让「把背景残差编码进 \(z\)」这件事在梯度上不再划算。

3.3 Action-centric Contrastive Learning

一个辅助投影头 \(r_\omega\)\(z^{\mathrm{CD}}\) 映到归一化嵌入 \(v_i\),用 SigLIP 式的成对 sigmoid loss:

\[\mathcal L_{\mathrm{ctr}} = \frac{1}{|\mathcal P|}\sum_{(i,j)\in\mathcal P}\mathrm{softplus}\big(-y_{ij}(\tau v_i^\top v_j + b)\big)\]

\(y_{ij}=+1\) 表示同 primitive,\(-1\) 表示不同。Primitive 标签是 12 类 canonical 动词:pick–place, insert–remove, stack–unstack, scoop–dump, open, close, turn on, turn off, wash–rinse, cut, stir, pour。来源是 clip caption 的主动词,经词形还原 → 语义聚类合并近义词 → 归入 12 类。

覆盖率:clean-ego index 的 68,864 个 transition pair 中只有 25,192 (36.6%) 有标签;扩到 ego+robot 后 91,664 个有标签。分布长尾(pick–place 占主导),一个 batch 的有效 primitive 数(指数化标签熵)只有 8–10

3.4 Latent Space Calibration

\[\mathcal L_{\mathrm{cal}} = \mathcal L_{\mathrm{KL\text{-}fb}} + \mathcal L_{\mathrm{zero}}\]
  • Free-bits KL:只在超过 per-dimension floor 时才罚,做容量控制而不压死正常 transition 的变化。
  • 零转移锚定
\[\mathcal L_{\mathrm{zero}} = \mathbb E_{o_t}\Big[\Big(\Big[\tfrac{\|z_t^0\|_2}{\mathrm{sg}(s_\Delta)+\epsilon} - m_{\mathrm{zero}}\Big]_+\Big)^2\Big]\]

其中 \(z_t^0 = \mu_\phi(o_t,o_t)\) 是重复帧对的 latent,\(s_\Delta\) 是普通 transition latent 范数的 running RMS,\(\mathrm{sg}\) 是 stop-gradient。含义是:把「什么都没发生」的 latent 范数压到正常 transition 典型范数的 \(m_{\mathrm{zero}}\) 倍以下,同时不让正常 transition 塌缩。

3.5 三阶段训练

  1. Stage 1(LAM Debiased Fine-tuning):用 \(\mathcal L_{\mathrm{CD}}\) 在无动作标注视频上微调 LAM。1k 步,per-GPU batch 32。
  2. Stage 2(ACWM Debiased Fine-tuning):提取 \(z^{\mathrm{CD}}\),继续训 ACWM。2k 步,per-GPU batch 12 (2B) / 2 (14B)。
  3. Stage 3(Robot Action Adaptation):一个轻量 MLP bridge \(g_\eta\) 回归 stop-gradient 的 CD-LAM latent,\(g_\eta(u_t)\approx \mathrm{sg}(\mu_\phi(o_t,o_{t+1}))\),外加一个 cycle-consistency 的 action readout。最终 checkpoint:3k 步 (2B) / 6k 步 (14B)

3.6 评测指标:FDCE

Foreground Displacement Chamfer Error 是本文自己提出的 action-following 指标。用 SAM3 取前景 mask,用 CoWTracker 在前景内做点跟踪,每对 rollout 采样最多 16 个有效锚点。定义位移向量 \(a_j^s = p_j^s - p_j^0\)(相对首帧),轨迹间代价 \(c_{ij} = \frac1H\sum_s\|\hat a_i^s - a_j^s\|_2\),然后取对称 Chamfer:

\[\mathrm{FDCE} = \frac{1}{2N_g}\sum_i \min_j c_{ij} + \frac{1}{2N_r}\sum_j \min_i c_{ij}\]

单位是像素,同时报 mean(对灾难性失败敏感)和 median(反映典型行为)。

关键动机数据:PSNR 与 FDCE 的相关只有 \(r=-0.38\)\(R^2=0.14\)——像素保真度几乎解释不了 action following。

PSNR vs FDCE Figure 3:PSNR–FDCE 散点。\(R^2=0.14\) 意味着 86% 的 action-following 方差是 PSNR 看不见的。这张图是全文最有说服力的一张——它论证了「为什么需要一个新指标」,而不是论证 CD-LAM 好。

3.7 实验设置与算力

  • 硬件:96 张 H100
  • Stage 2 评测:EgoDex 的 300 条 held-out clip
  • Stage 3 评测:AgiBot 的 300 条 clip(来自不同 episode)
  • 默认 debiasing 数据档位:100h(除非特别说明)
  • LAM 语料:100h 档 = 100.030h / 71,070 segments / 10.1M frames,主要来自 EgoExo4D 25.3%、EgoDex 13.5%、egoverse_v2 10.6%、Ego4D 10.5%、agibot_beta 2.0%
  • 干预协议:固定观测历史,只替换 conditioning action。零动作 \(\mathrm{do}(u_t=0)\) 应抑制运动;目标动作迁移 \(\mathrm{do}(u_t=u_t^{\mathrm{tar}})\) 应复现目标动态

4. 结果对比

4.1 LAM 侧审计(Stage 1)

Diagnostic DreamDojo LAM CD-LAM
零转移响应(重复帧对,相对范数 ↓)
 中位响应 0.527 0.043
 绝对 latent 范数(中位) 3.119 0.226
相机平移鲁棒性(合成平移 3 px,相对范数 ↓)
 水平(mean / median) 0.555 / 0.536 0.156 / 0.096
 垂直(mean / median) 0.545 / 0.529 0.110 / 0.064
动作邻域结构(hard-negative ↓)
 shortcut leakage 0.151 0.014

保留性检查:同 primitive 跨 episode 的 cosine 基本不变(0.132 → 0.131),说明不是把整个空间无差别缩小。相机平移响应缩小 3.6–8.3×。

4.2 Latent action 条件 rollout(Stage 2,EgoDex n=300)

Backbone Model FDCE ↓ PSNR ↑ SSIM ↑ LPIPS ↓ 迁移 PSNR ↑ 迁移 SSIM ↑ 迁移 LPIPS ↓ 迁移 FDCE ↓
2B DreamDojo 34.00 20.88 0.780 0.413 13.02 0.598 0.643 42.74
2B CD-LAM 19.63 24.29 0.827 0.308 13.15 0.588 0.600 33.81
14B DreamDojo 40.29 21.04 0.792 0.398 13.11 0.593 0.631 50.27
14B CD-LAM 29.87 23.18 0.814 0.342 13.03 0.597 0.617 33.22

FDCE 降幅 −42.3% (2B) / −25.9% (14B);迁移 FDCE 降幅 −20.9% / −33.9%。

一个值得注意的观察:baseline 的 FDCE 从 2B 到 14B 反而变差(34.00 → 40.29,迁移 42.74 → 50.27)。作者据此论证「scale 不能替代 debiasing」。另外迁移设定下的 PSNR 全都在 13 dB 左右——两个模型都低得离谱,说明迁移 rollout 在像素上跟参考基本对不上,那一栏的 PSNR/SSIM 差异不该被解读。

4.3 机器人动作 rollout(Stage 3,AgiBot n=300)— 主结果

Backbone Model FDCE\(_\text{mean}\) FDCE\(_\text{med}\) PSNR ↑ SSIM ↑ LPIPS ↓ \(\mathrm{do}(u_t{=}0)\) \(\mathrm{do}(u_t{=}u^{\mathrm{tar}}_t)\)
2B DreamDojo 12.63 8.15 19.85 0.798 0.271 10.71 24.36
2B CD-LAM 8.24 6.75 20.60 0.806 0.269 5.03 22.55
14B DreamDojo 11.11 8.98 20.01 0.808 0.263 9.36 24.82
14B CD-LAM 7.73 5.99 21.01 0.818 0.247 2.18 21.11

FDCE\(_\text{mean}\)−34.8% / −30.4%。注意两类干预的落差极大:

  • 零动作干预:2B 10.71→5.03(−53%),14B 9.36→2.18(−77%
  • 目标动作迁移:2B 24.36→22.55(−7.4%),14B 24.82→21.11(−15.0%)

零动作那一列是「对着静止参考算的残余运动」,和 rollout 列不可比。最漂亮的那个数字(−77%)恰好是 \(\mathcal L_{\mathrm{zero}}\) 直接优化的量——见 §5.2 第 4 条。

Post-training panels Figure 4a:(a) 八个动作类别上的 FDCE 分解,说明收益不是集中在单一 primitive(附录的完整分解里 CD-LAM 在少数类别上与 baseline 持平或略输);(b) 2B 上整个 rollout 分布向低 FDCE、高 PSNR 移动。这两张图回答了「是不是靠个别样本拉出来的」,做得不错。

Rollouts Figure 4:2B / 14B 下的定性 rollout。四行分别是 GT、DreamDojo、CD-LAM,所有模型行从同一初始帧出发、接收同一条机器人动作序列。DreamDojo 的机械臂位姿会从 GT 轨迹漂走,且 scale 到 14B 并不能修复这个漂移。

4.4 Debiasing 数据 scaling(2B)

Model PSNR ↑ FDCE\(_\text{mean}\) FDCE\(_\text{med}\)
DreamDojo 19.85 12.63 8.15
CD-LAM-1h 20.54 8.91 6.88
CD-LAM-10h 20.61 8.87 6.23
CD-LAM-100h(主结果用的档) 20.60 8.24 6.75
CD-LAM-1000h 20.64 7.97 6.12

论文的读法:1h 档已经拿到 1000h 档 FDCE 改进的约 80%(3.72 / 4.66),所以收益主要来自 debiasing 本身而非数据规模。

但注意 FDCE\(_\text{med}\) 并不单调:6.88 → 6.23 → 6.75 → 6.12。主结果用的 100h 档在中位数上输给 10h 档

4.5 Robot action adaptation 效率

Efficiency curve Figure 5:14B 的 aligned-protocol 训练曲线。橙色虚线是 DreamDojo 参考(PSNR≈20.0、FDCE≈11.11,正好是 Table 4 里 DreamDojo-14B 那一行)。CD-LAM 在约 3k 步越过 FDCE 线、3–4k 步越过 PSNR 线,6k 时明显超过。「>12×」= 50k / 4k。注意图上只有一条 CD-LAM 曲线和一条水平线——没有 DreamDojo 在同协议下的训练曲线。

4.6 目标函数消融

Objective PSNR ↑ FG-PSNR ↑ Cam-shift x/y ↓ FDCE ↓
Full CD-LAM 29.64 26.57 0.133 / 0.101 17.23
w/o embodiment-centric weighting 29.53 26.26 0.134 / 0.100 18.40
w/o action-centric contrast 29.64 26.57 0.134 / 0.101 19.07
w/o zero-transition calibration 29.31 26.48 0.637 / 0.637 16.10

†论文脚注:该变体 FDCE 更低,但过不了上游相机平移诊断,因此不解读为「更好的去偏」。

(该表用的是独立的 ablation 评测设置,绝对值与 Table 4 不可比。)


5. 引申问题 / 讨论

说明:下面 §5.2 有相当一部分证据来自 arXiv 源码包里未被编译进最终 PDF 的文件——sections/07_limitations.tex(在 main.tex 里被注释掉)、sections/08_appendix_bak.tex,以及十余个未被 \input_tab_*.tex / _fig_*.tex 草稿片段。这些文件里保留了作者之间的内部批注(\cnote{} 宏)和被删掉的对照实验。它们不是最终论文的主张,但能说明作者知道什么、以及最后选择呈现什么。

5.1 做得好的地方

  1. 问题定位是对的,而且定位方式很干净。 「LAM 训练时 \(z_t\) 是转移摘要,ACWM 部署时 \(z_t\) 是干预 handle」——这个角色切换的观察本身就值回票价。更重要的是他们把诊断放在了正确的位置:不是去看 rollout 好不好看,而是直接审计 encoder \((o_t,o_{t+1})\mapsto z_t\),三个诊断(重复帧、合成平移、episode shortcut)各自对应式 (5) 里的一个因子。0.527 → 0.043 这种量级的变化是实打实的。

  2. PSNR 和 action following 的解耦证据(\(R^2=0.14\))是全文最硬的一块。 这不是在证明 CD-LAM 好,而是在证明整个领域的评测方式有问题——一个模型可以照抄 context 拿到漂亮 PSNR 而完全不听指令。这个结论独立于 CD-LAM 是否成立,对社区更有价值。

  3. FDCE 的设计考虑了对抗自己的情况。 锚点种在腐蚀过的前景 mask 内、低可见度轨迹在打分前丢弃、对称 Chamfer 只算位移几何而不奖励点数匹配。作者明确写了已知失败模式(遮挡、运动模糊、无纹理夹爪上的 tracker 漂移)是 tracker-limited,且会同时抬高所有被比模型在同一 clip 上的分数,因此偏向 null。这种「我的指标怎样会对我不利」的自我审视不常见。

  4. 保留性检查做对了。 报 shortcut leakage 从 0.151 掉到 0.014 的同时,报「同 primitive 跨 episode 的 cosine 基本不变(0.132 → 0.131)」——这直接排除了「去偏 = 把整个 latent 空间压塌」这个最廉价的作弊解释。很多做表征去偏的论文缺这一步。

  5. 「scale 不能替代 debiasing」这个负面结果讲得很有分量。 baseline 的 FDCE 从 2B 到 14B 变差(34.00 → 40.29),FDCE\(_\text{med}\) 在 Stage 3 也从 8.15 变差到 8.98。这说明更大的 backbone 买到的是视觉能力而不是可控性——是个对领域有校准作用的观察。

  6. 接口不变这一点是工程上的正确选择。 ACWM 架构、latent 维度、conditioning 格式全都不动,只换 LAM 的 latent 空间。这让「所有差异都归因于 LAM 去偏」这个论证在原理上站得住(虽然实践上有 §5.2 第 3 条的问题)。

5.2 做得不够好的地方 / 值得质疑的地方

  1. 论文没有 Limitations 章节——它被从编译中删掉了。 main.tex 第 254 行是 % \input{sections/07_limitations}。而那个文件里躺着四段限制说明和四条作者内部批注,其中一条明确写着:「两个审稿人一定会期待但现在缺失的限制:(1) CD-LAM 的额外监督(SAM3 mask、粗 primitive 标签)及其成本与失败模式;(2) 所有证据都是 world-model rollout——还没有任何 policy learning 或真机闭环控制结果」,后面还附了准备补写的草稿文字。最终的处理方式是:草稿没被补进去,整节被删掉。

  2. 「>12× fewer updates」这个 headline 的对比口径是混的。 实验设置里两句话直接打架:先说「在所有效率对比中,步数都是 aligned protocol 下的 optimizer update,两个模型用同样的数据、batch、优化器设置,所以步数可直接比较」,紧接着说「Fig. 1(c) 里的 50k 参考和 Fig. 5 的虚线是 DreamDojo 的完整原始预算」。也就是说:分子(CD-LAM 3k/6k)在 aligned protocol 下,分母(50k)不在。Figure 5 里也只有一条 CD-LAM 曲线撞一条水平线——没有 DreamDojo 在同协议下的训练曲线。被删掉的 limitations 恰恰写明了这一点:「我们还没跑的对照是在完全相同配方和预算下重训一个 DreamDojo」,并且旁边的内部批注写道:「这段看起来过时了:Table 4 现在有 DreamDojo-14B 在 aligned protocol 下的行——如果那个 run 存在,这段就在拆你自己的台;如果不存在,表格需要加脚注。二选一,把它解决掉。」最终既没解决也没加脚注,而是删了整节。

  3. 训练目标和评测指标共用同一个前景分割器。 \(\mathcal L_{\mathrm{emb}}\) 用 SAM3 mask 给重建加权,FDCE 用 SAM3 mask 选前景再跟踪。CD-LAM 被训练去「在 SAM3 认定的前景区域上重建得更准」,然后被「在 SAM3 认定的前景区域上的位移误差」评判,而 baseline 从头到尾没见过 SAM3。这不是致命的(FDCE 比的是位移几何不是像素),但它是一条从训练信号直通评测信号的通道,论文完全没有讨论。最小的对照是:给 DreamDojo 的 LAM 也做一次同等步数的前景加权重建微调,看能吃掉多少 gap。

  4. 最亮眼的干预数字,恰好是训练目标直接优化的那个量。 14B 的零动作干预 9.36 → 2.18(−77%)是全文最抢眼的数字,也是 Figure 1 叙事的落点。但 \(\mathcal L_{\mathrm{zero}}\) 做的事就是把 \(\|\mu_\phi(o_t,o_t)\|\) 压到接近零,Stage 2 让 ACWM 学会「近零 latent ⇒ 不动」,Stage 3 的 bridge 把 \(u=0\) 映到近零 latent。整条链路是被显式安装进去的,不是涌现的可控性。真正独立的检验是目标动作迁移,而那一栏只有 −7.4% / −15.0%——比零动作弱一个数量级。论文把两者并列呈现,但它们的证据强度完全不同。

  5. 被删掉的草稿里有一张表显示:零动作优势在 100h/1000h 档上会翻转。 _tab_zeroaction.tex(未编译)报的是 n=20 trend subset 上的零动作静止探针:DreamDojo 10.71 mean / 3.62 med;CD-LAM-1h 4.55 / 1.19;10h 4.58 / 1.68100h 11.08 / 4.85(比 baseline 差);1000h 8.65 / 6.58(中位数比 baseline 差)。而论文主结果用的正是 100h 档,Table 4 里 2B 的零动作是 5.03。两处数字对不上(协议和 n 都不同),但方向性的问题是实在的:在作者自己算过的某个设定下,零动作优势属于 1h/10h 小档位,到 100h/1000h 就没了甚至反转。另外 14B 的 2.18 在两张表里逐字相同,而同一列的 DreamDojo-14B 从 10.44 变成 9.36——两个数字来自不同的评测批次却被放进同一列。

  6. 被删掉的附录里有作者自己算的 bootstrap 置信区间,结论是主档位不显著。 08_appendix_bak.tex(未编译)写道:clip-level bootstrap(4000 次重采样,n≈300),「CD-LAM-1h 的 mean FDCE gap 是 −4.0 px(95% CI [−5.8, −2.3]),10h 是 −2.8 px([−4.7, −0.8]),都不含零。更大的 100h/1000h 档落在 baseline 的 CI 之内——mean gap 分别是 +0.5 和 −0.7 px,95% CI 为 [−1.6, 2.7] 和 [−2.6, 1.2],都跨过零——所以它们与 DreamDojo 没有显著差异」。那是在另一套评测协议下算的(数字与最终 Table 4 对不上),但事实是:这个团队做过不确定性分析,发现主档位不显著,最终论文里没有任何一个置信区间、误差棒或显著性检验。

  7. Table 5 的「isolates data quantity at fixed compute」这句话,与作者自己的 exposure 账本矛盾。 该表 caption 声称「所有档位共享同样的 1k 步 Stage-1 预算,因此比较隔离了数据量」。但固定步数、增大语料,必然意味着 epochs-over-corpus 在下降——1h 档在 1k 步里把它的数据看了几百遍,1000h 档连一遍都不到。被删的 limitations 第一段就写:「我们不把 1h/10h 阶梯读作数据效率排序:这些档位的 world-model exposure 不同」,被删的附录更把这条上升为「本文的核心记账纪律是:一个训练步是算力单位,不是模型实际看了多少含动作视频,所以我们从不孤立地报告步数」,并给了具体数字(10h WM 在 step 2000 达到 1.559× strict frame-token coverage,100h WM 同一步只有 0.473×,差 3.3×)。内部批注也点名了这处矛盾。最终论文的处理是:删掉纪律,保留「1h 已拿到 80% 收益」的数据效率解读,再给表加一句「隔离了数据量」的 caption。而唯一一个真正固定 world model 的对照_tab_lessmore.tex,100h vs 1000h LAM)显示两者完全打平(encoded PSNR 24.90 vs 24.90,official PSNR 22.84 vs 22.84)——这张表也被删了。

  8. Stage 3 的 bridge 拟合质量很差,而且这个数字被删了。 被删附录写:「action-to-latent 的拟合仍是瓶颈,a2z \(R^2 \approx 0.28\),我们如实报告:bridge 证明的是真实动作可以部分进入同一 \(z\) 空间,不是这个映射很紧」。\(R^2=0.28\) 意味着机器人动作只解释了目标 latent 28% 的方差——而整个 Stage 3、以及全部真机动作 following 结果,都建立在这个映射上。最终论文对 bridge 的描述只有一句「a lightweight MLP bridge \(g_\eta\) is trained to regress the gradient-stopped CD-LAM latent」,没有任何拟合质量指标。

  9. Bridge 在 6 个 embodiment 里有 2 个是负的,主结果用的那个是最弱的「可用」档。 _tab_bridge.tex(未编译):RoboTwin 20D +2.41 dB「usable」、AgiBot-β 20D +1.26「usable」、AgiBot-β 22D +1.07「usable」、AgiBot Alpha 20D +0.71「weak-positive」DROID 20D −0.16「negative」Galaxea 20D −0.30「negative」。主结果跑在 AgiBot 上。一个宣称要解决跨 embodiment 数据瓶颈的方法,其动作接入模块在三分之一的 embodiment 上失效——这是核心信息,完全没进论文。

  10. 被删附录还记录了一个与「non-collapsed」主张直接冲突的测量。 Stage 3 的联合训练把 latent 的 per-dimension std 从 0.860 降到 0.474、participation ratio 从 18.83 降到 8.97(有效维度腰斩),同时把 robot-identity 线性探针准确率从 0.418 抬到 0.522。作者自己的判语是「更 robot-specific 的 \(z\) 会改善源机器人的 bridge 拟合,但这是跨机器人迁移风险的警示信号」。而论文正文反复强调 calibration 的作用是「calibrated non-collapsed latent action representations」——有效维度掉一半这件事没有出现在最终版本里。

  11. 消融表里,被称为「dominant」的那一项让 headline 指标变差。 去掉 zero-transition calibration,相机平移响应从 0.133/0.101 涨到 0.637/0.637(4.8×/6.3×,确实是它在管这件事),但 FDCE 反而从 17.23 降到 16.10(更好)。论文加脚注说「不解读为更好的去偏」。这个处理不算不诚实,但它暴露了一个真问题:三个目标里最重要的那个,在下游 action-following 指标上是负贡献。此外「w/o action-centric contrast」那一行的 PSNR 和 FG-PSNR 与完整模型逐位相同(29.64 / 26.57),论文只说「identical at reported precision」——两个指标同时精确相同,更像是那两列没有为这一行重新测量。

  12. 「Causal」是一层修辞包装,不是技术内容。 全文没有 SCM、没有可识别性结果、没有 do-calculus 推导。式 (5) 只是 \(z\approx f(A,C,V)\) 加一句「目标函数没有阻止 \(z\) 依赖 \(C,V\)」。三个损失分别是:mask 加权重建、带标签的 SigLIP 成对损失、free-bits KL + 范数 margin——都是标准表征学习技术。更有意思的是:草稿里原本有一句诚实的免责声明「This is an operational causal view, not an identification claim: we do not assume the true physical action is recoverable from pixels」,在最终版被注释掉了(03_interface.tex 第 12 行)——免责声明删了,因果措辞留着

  13. 对比学习引入了 caption 监督,这动摇了「从无标注视频 scale」的动机。 \(\mathcal L_{\mathrm{ctr}}\) 需要 clip caption 里的动词。论文的辩护是「只是 verb-level,不含 controller state,所以没变成有监督的机器人动作学习」——这个辩护成立,但没回答真正的问题:Ego4D / EgoExo4D 有 caption,随手抓的网络视频没有。而且覆盖率只有 36.6%,一个 batch 的有效 primitive 只有 8–10 类。LAM 存在的理由就是「人类视频便宜」,现在这条路上多了一个标注依赖。

  14. 只有一个 baseline,而且是 pipeline 的宿主。 全文唯一对比对象是 DreamDojo。同期直接相关的工作——ConLA(对比式 latent action,2026-02)、AdaWorld、Moto、IGOR——一个都没有实验对比。尤其是 ConLA,名字里就写着 contrastive latent action,与本文的 \(\mathcal L_{\mathrm{ctr}}\) 高度重合,只在 related work 里被引用了一次。

  15. 「efficient」的账没算完。 12× 只统计 Stage 3 的 optimizer update,不含 Stage 1(1k 步)和 Stage 2(2k 步),也不含 SAM3 在整个语料上跑 mask 的开销、caption 动词抽取与聚类的开销。全文跑在 96 张 H100 上却没有报任何 GPU-hour 或 wall-clock。对一篇把 efficiency 写进摘要和 Figure 1 的论文,这是应该给的数字。

  16. 完全没有 policy learning 或闭环控制结果。 所有证据都是 world-model rollout 与像素/轨迹指标。ACWM 的价值主张是 planning、policy evaluation、data augmentation——三个都没测。这条恰好是被删 limitations 里那条内部批注点名的第二项。

5.3 值得继续探讨的方向

  • 把被删的对照实验补回来,就是最好的下一篇。 优先级排序:(1) 在同一 aligned protocol 下重训 DreamDojo 的 Stage 3,给出真正的双曲线效率对比;(2) 恢复 clip-level bootstrap CI,让 100h 档的显著性问题有个明确答案;(3) 补上「DreamDojo latent + 同一 bridge」这个被作者自己标记为 unverified missing baseline 的 cell。这三件事做完,这篇论文的结论强度会完全不同。

  • 解开指标与训练信号的耦合。 用一个与训练时不同的分割器(SAM2、或人工标注的 mask)重算 FDCE;同时给 DreamDojo 的 LAM 做等步数的前景加权重建微调作为「便宜版 CD-LAM」对照。如果 gap 大部分被吃掉,那真正起作用的是前景加权而不是「因果去偏」。

  • \(\mathcal L_{\mathrm{zero}}\) 从评测里摘出去。 零动作那一列既然是训练目标的直接产物,就该当成 sanity check 报告,而把 action-following 的主张压在目标动作迁移和一个新的、训练时没见过的干预类型上(例如动作幅度缩放 \(\mathrm{do}(u_t = \alpha u_t)\),检验 latent 空间是否有正确的尺度语义,而不只是方向)。

  • a2z \(R^2 = 0.28\) 是最值得追的技术问题。 只解释 28% 方差还能拿到这些结果,说明 ACWM 对 latent 的精度并不敏感,或者 latent 里剩下的 72% 本来就不该由动作决定。做一个 \(R^2\) 与下游 FDCE 的关系曲线,能直接回答「latent 空间的干净程度」和「bridge 拟合质量」哪个才是真瓶颈。

  • 跨 embodiment 才是这套方法的真正考验。 DROID 和 Galaxea 上 bridge 为负这件事需要一个解释。是动作空间维度不匹配、控制频率不同、还是 latent 空间已经过拟合到 AgiBot?被删附录里 robot-identity 探针从 0.418 涨到 0.522 已经给了一个假说,值得正面做实验。

  • participation ratio 腰斩需要被修复而不是被隐藏。 既然 calibration 的设计初衷就是 non-collapse,那 Stage 3 联合训练把有效维度从 18.83 压到 8.97 是个设计缺陷。可以试:Stage 3 冻结 LAM 的同时给 bridge 加一个 latent 分布匹配项(例如对齐 \(g_\eta(u)\)\(\mu_\phi\) 的协方差谱)。

  • 和 ConLA / Moto / IGOR 正面比。 尤其 ConLA,思路重合度最高。如果 CD-LAM 的三项里只有对比学习那一项在起作用,那这篇的贡献叙事需要重写。

  • 验证 ACWM 真的能当模拟器用。 最有说服力的下游实验是:用 debiased ACWM 做 policy evaluation,看它对策略的排序是否与真机排序一致(类似 SIMPLER 的 real-to-sim 相关性分析)。FDCE 降 30% 如果换算不出排序相关性的提升,那这个指标本身的价值也要打问号。

  • 粗动词标签能不能自举掉。 现在依赖 caption。可以试用 LAM 自身的 latent 做聚类得到伪 primitive,迭代式地自监督——如果成立,「需要 caption」这个软肋就消失了,方法才真的能 scale 到无标注视频。


参考资源

  • 论文 PDF: paper.pdf
  • LaTeX 源码: source/ — 注意 sections/07_limitations.texsections/08_appendix_bak.tex 未被编译进最终 PDF,内含作者内部批注与被删对照实验
  • 代码 / 项目页 / 模型: GitHub · Project Page · HuggingFace
  • 关键 baseline / 相关论文:
  • DreamDojo — Gao, Liang, Zheng, ..., A Generalist Robot World Model from Large-Scale Human Videos(唯一 baseline,也是 pipeline 宿主)
  • AdaWorld — Gao, Zhou, Du, Zhang, Gan, ICML 2025(同一位一作,latent action 作为可迁移 condition)
  • Genie — Bruce et al., 2024(离散 latent action codebook 的开山工作)
  • LAPO — Schmidt & Jiang;LAPA — Ye et al.
  • What Do Latent Action Models Actually Learn? — Zhang, Pearce et al., NeurIPS 2025
  • Latent Action Learning Requires Supervision in the Presence of Distractors — Nikulin et al., ICML
  • ConLA — Dai et al., arXiv 2602.00557(对比式 latent action,同期最相关但未做实验对比)
  • SAM 3 — Carion et al.;CoWTracker — Lai, Insafutdinov, Sucar, Vedaldi, arXiv 2602.04877
  • EgoDex — Hoque et al., arXiv 2505.11709;AgiBot World Colosseo — AgiBot-World-Contributors et al.
  • MotionPro — 2025(ObjMC,FDCE 的思想来源)