CD-LAM: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models¶
论文阅读笔记 — 用于后续讨论的概览
Figure 1:(a)(b)(c) 三个 headline 数字(FDCE −34.8%/−30.4%、PSNR +0.75/+1.0 dB、步数 50k→3k/6k)。注意 (c) 的对比口径——CD-LAM 的 3k/6k 是「aligned protocol」下的步数,而 50k 是 DreamDojo 原始完整预算,两者并不在同一协议下,详见 §5.2 第 2 条。(d) 是全文的因果叙事:reconstruction-only 的 LAM 会把 confound 从紫色路径漏进 action condition,CD-LAM 把它掐掉。
1. 基础信息¶
- 题目: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
- 作者: Yufan Wei¹²*, Kun Zhou¹†, Lingjun Mao¹²*, Zijun Zhang¹, Ziming Xu¹, Ziqiao Xi¹, Shuang Liang¹²*, Ruobing Han¹, Yuchen Yan¹, Xinyue Wang¹²*, Fan Feng¹, Biwei Huang¹
- ¹ Aether AI ² University of California, San Diego
- * 实习期间完成 † Project Lead & 通讯
franciskunzhou@gmail.com - 末作 Biwei Huang 是 UCSD 做因果发现/因果表征的研究者,这解释了全文的 causal framing
- arXiv 编号: 2607.09185(2026-07 提交,IEEEtran conference 模板)
- 资源: Code · Project Page · Model
- 关键词: latent action models, action-conditioned world models, causal debiasing, controllability, FDCE, DreamDojo
2. 文章介绍¶
2.1 解决的领域和问题¶
Action-conditioned world model (ACWM) 想做的事是:给定当前观测 \(o_{\le t}\) 和一段动作序列 \(u_{t:t+H-1}\),预测未来观测 \(o_{t+1:t+H}\)——本质是一个可以用动作「操纵」的视频生成器,用来做 planning、policy evaluation、data augmentation。
瓶颈很直白:训练可控的 ACWM 需要带动作标注的大规模数据,但真机数据贵。人类视频(Ego4D / EgoExo4D / EgoDex)便宜且量大,却没有可执行动作标签。Latent Action Model (LAM) 是这条路上的标准桥梁:从相邻帧 \(\langle o_t, o_{t+1}\rangle\) 推断一个 latent action \(z_t \in \mathbb{R}^d\),用它当 proxy action 去预训练 ACWM,最后再把真实机器人动作对齐到同一个 latent 空间(AdaWorld、DreamDojo 就是这个配方)。
本文要打的靶子是:这个 \(z_t\) 是用重建损失训出来的,而重建损失根本不管 \(z_t\) 里装的是不是「动作」。
2.2 Motivation¶
核心论断用一个式子概括:
其中 \(A_t\) 是 embodiment 动作效应,\(C_t\) 是场景 context,\(V_t\) 是 source-side 视觉因素(背景延续、外观连续性)。重建目标只要求 predictive sufficiency——只要能帮着预测 \(o_{t+1}\),任何因素都可以进 \(z_t\)。
问题在于角色切换:LAM 训练时 \(z_t\) 是「转移的摘要」,ACWM 部署时 \(z_t\) 却被当作「可干预的控制信号」。一旦 \(C_t, V_t\) 混进去,条件就不再只指定 embodiment dynamics,而是部分指定了「视频该怎么往下续」。到了 Stage 3,真实机器人动作 \(u_t\) 能对齐 \(A_t\),但根本无法指定背景延续或相机残差——于是 \(u_t\) 被强行对齐到一个部分不可执行的 latent 空间,结果就是 action following 很弱。
论文管这个叫 action-irrelevant confounding。
Figure 0:motivating failure。2B DreamDojo ACWM 在 AgiBot 上完成 robot action adaptation 之后,固定初始帧、把所有相对机器人动作全部置零,rollout 依然在动。这就是「动作条件没有锚住 embodiment」最直观的证据,也是全文的出发点。
2.3 之前工作的问题¶
| 类别 | 代表工作 | 缺陷 |
|---|---|---|
| 离散 latent action | Genie, LAPA, LAPO | codebook 量化 inter-frame 变化,目标仍是重建;靠 scale 数据和 codebook 大小 |
| 连续 latent action + WM | AdaWorld, DreamDojo | 把 latent action 当作可迁移 condition,但 LAM 本身仍是 reconstruction-only;本文的直接 baseline |
| 运动 tokenize 变体 | Moto, IGOR | 同样 associative,把 inter-frame motion / image-goal change 编码进共享空间 |
| 已经指出 LAM 有问题的工作 | What Do LAMs Actually Learn? (NeurIPS'25), Latent Action Learning Requires Supervision in the Presence of Distractors (ICML), ConLA | 诊断出了 distractor 问题,但没给出针对 ACWM controllability 的系统修复 |
| 视频世界模型评测 | PSNR / FVD | 奖励「像」而不奖励「听话」——模型可以照抄 context 拿高分却完全无视 action condition |
| 运动跟随评测 | MotionPro (ObjMC) | 有 tracking-based 思路,但不针对 embodied manipulation 的前景 |
| 因果去偏 | IRM, shortcut learning, causal confusion in IL | 去偏的是输入;本文去偏的是条件变量(downstream 当作干预 handle 的那个量) |
2.4 论文解决方案(一句话)¶
不改 ACWM 架构、不改 conditioning 格式,只在 LAM 上加三个 fine-tuning 目标(前景加权重建 + 动词标签对比学习 + free-bits KL 与零转移锚定),把 latent action 空间里的 action-irrelevant 成分洗掉,再让下游 ACWM 和机器人动作 bridge 继承这个干净空间。
2.5 与前序工作的关系¶
DreamDojo(Shenyuan Gao 等,A Generalist Robot World Model from Large-Scale Human Videos)是唯一的 baseline,也是整个 pipeline 的宿主——CD-LAM 复用它的 LAM checkpoint(~709.8M 参数,latent 维度 32)、它的 2B / 14B ACWM backbone、它的 conditioning 格式。同一位 Shenyuan Gao 也是 AdaWorld 的一作,所以本文实际是在 AdaWorld → DreamDojo 这条线上做外科手术。
CD-LAM 额外引入了 baseline 没有的两种监督:SAM3 前景 mask、以及从 caption 动词聚类出的 12 类粗动作 primitive 标签。这一点论文在 Setup 里明说了,但没有做对应的控制实验(详见 §5.2)。
3. 方法介绍¶
Figure 2:左侧是被改造的 LAM(encoder → 32 维 latent → decoder)。底部蓝框是 Stage 1 的三个目标:embodiment-centric reconstruction(前景/背景差异化加权)、action-centric contrastive(同 primitive 拉近、异 primitive 推开)、latent space calibration(重复帧对映射到零点附近)。右侧 ②③ 是 Stage 2(用 debiased latent 继续训 ACWM)和 Stage 3(一个 Bridge 把可执行机器人动作映射进同一空间)。注意整条链路上 ACWM 的 conditioning 接口从未改变——这是这篇方法「可插拔」的关键。
3.1 形式化¶
LAM 写成 encoder-decoder:
标准目标只有重建 + 一个容量正则:\(\mathcal L_{\mathrm{LAM}} = \mathbb E[\ell(D_\psi(o_t,z_t), o_{t+1})] + \mathrm{Reg}(z_t)\)。
ACWM 在 latent 阶段的条件分布是 \(p_\theta(o_{t+1:t+H}\mid o_{\le t}, z_{t:t+H-1})\)。
CD-LAM 的总目标:
(\(\lambda_{\mathrm{ctr}}\) 随训练步 \(k\) 变化;\(t\) 保留给帧时间。)
3.2 Embodiment-centric Reconstruction¶
用 SAM3 拿到 embodiment-object 前景 mask \(M_t\in[0,1]^{h\times w}\),构造空间权重
背景权重保持非零以维持全局视觉一致性。思路是:让「把背景残差编码进 \(z\)」这件事在梯度上不再划算。
3.3 Action-centric Contrastive Learning¶
一个辅助投影头 \(r_\omega\) 把 \(z^{\mathrm{CD}}\) 映到归一化嵌入 \(v_i\),用 SigLIP 式的成对 sigmoid loss:
\(y_{ij}=+1\) 表示同 primitive,\(-1\) 表示不同。Primitive 标签是 12 类 canonical 动词:pick–place, insert–remove, stack–unstack, scoop–dump, open, close, turn on, turn off, wash–rinse, cut, stir, pour。来源是 clip caption 的主动词,经词形还原 → 语义聚类合并近义词 → 归入 12 类。
覆盖率:clean-ego index 的 68,864 个 transition pair 中只有 25,192 (36.6%) 有标签;扩到 ego+robot 后 91,664 个有标签。分布长尾(pick–place 占主导),一个 batch 的有效 primitive 数(指数化标签熵)只有 8–10。
3.4 Latent Space Calibration¶
- Free-bits KL:只在超过 per-dimension floor 时才罚,做容量控制而不压死正常 transition 的变化。
- 零转移锚定:
其中 \(z_t^0 = \mu_\phi(o_t,o_t)\) 是重复帧对的 latent,\(s_\Delta\) 是普通 transition latent 范数的 running RMS,\(\mathrm{sg}\) 是 stop-gradient。含义是:把「什么都没发生」的 latent 范数压到正常 transition 典型范数的 \(m_{\mathrm{zero}}\) 倍以下,同时不让正常 transition 塌缩。
3.5 三阶段训练¶
- Stage 1(LAM Debiased Fine-tuning):用 \(\mathcal L_{\mathrm{CD}}\) 在无动作标注视频上微调 LAM。1k 步,per-GPU batch 32。
- Stage 2(ACWM Debiased Fine-tuning):提取 \(z^{\mathrm{CD}}\),继续训 ACWM。2k 步,per-GPU batch 12 (2B) / 2 (14B)。
- Stage 3(Robot Action Adaptation):一个轻量 MLP bridge \(g_\eta\) 回归 stop-gradient 的 CD-LAM latent,\(g_\eta(u_t)\approx \mathrm{sg}(\mu_\phi(o_t,o_{t+1}))\),外加一个 cycle-consistency 的 action readout。最终 checkpoint:3k 步 (2B) / 6k 步 (14B)。
3.6 评测指标:FDCE¶
Foreground Displacement Chamfer Error 是本文自己提出的 action-following 指标。用 SAM3 取前景 mask,用 CoWTracker 在前景内做点跟踪,每对 rollout 采样最多 16 个有效锚点。定义位移向量 \(a_j^s = p_j^s - p_j^0\)(相对首帧),轨迹间代价 \(c_{ij} = \frac1H\sum_s\|\hat a_i^s - a_j^s\|_2\),然后取对称 Chamfer:
单位是像素,同时报 mean(对灾难性失败敏感)和 median(反映典型行为)。
关键动机数据:PSNR 与 FDCE 的相关只有 \(r=-0.38\),\(R^2=0.14\)——像素保真度几乎解释不了 action following。
Figure 3:PSNR–FDCE 散点。\(R^2=0.14\) 意味着 86% 的 action-following 方差是 PSNR 看不见的。这张图是全文最有说服力的一张——它论证了「为什么需要一个新指标」,而不是论证 CD-LAM 好。
3.7 实验设置与算力¶
- 硬件:96 张 H100
- Stage 2 评测:EgoDex 的 300 条 held-out clip
- Stage 3 评测:AgiBot 的 300 条 clip(来自不同 episode)
- 默认 debiasing 数据档位:100h(除非特别说明)
- LAM 语料:100h 档 = 100.030h / 71,070 segments / 10.1M frames,主要来自 EgoExo4D 25.3%、EgoDex 13.5%、egoverse_v2 10.6%、Ego4D 10.5%、agibot_beta 2.0%
- 干预协议:固定观测历史,只替换 conditioning action。零动作 \(\mathrm{do}(u_t=0)\) 应抑制运动;目标动作迁移 \(\mathrm{do}(u_t=u_t^{\mathrm{tar}})\) 应复现目标动态
4. 结果对比¶
4.1 LAM 侧审计(Stage 1)¶
| Diagnostic | DreamDojo LAM | CD-LAM |
|---|---|---|
| 零转移响应(重复帧对,相对范数 ↓) | ||
| 中位响应 | 0.527 | 0.043 |
| 绝对 latent 范数(中位) | 3.119 | 0.226 |
| 相机平移鲁棒性(合成平移 3 px,相对范数 ↓) | ||
| 水平(mean / median) | 0.555 / 0.536 | 0.156 / 0.096 |
| 垂直(mean / median) | 0.545 / 0.529 | 0.110 / 0.064 |
| 动作邻域结构(hard-negative ↓) | ||
| shortcut leakage | 0.151 | 0.014 |
保留性检查:同 primitive 跨 episode 的 cosine 基本不变(0.132 → 0.131),说明不是把整个空间无差别缩小。相机平移响应缩小 3.6–8.3×。
4.2 Latent action 条件 rollout(Stage 2,EgoDex n=300)¶
| Backbone | Model | FDCE ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 迁移 PSNR ↑ | 迁移 SSIM ↑ | 迁移 LPIPS ↓ | 迁移 FDCE ↓ |
|---|---|---|---|---|---|---|---|---|---|
| 2B | DreamDojo | 34.00 | 20.88 | 0.780 | 0.413 | 13.02 | 0.598 | 0.643 | 42.74 |
| 2B | CD-LAM | 19.63 | 24.29 | 0.827 | 0.308 | 13.15 | 0.588 | 0.600 | 33.81 |
| 14B | DreamDojo | 40.29 | 21.04 | 0.792 | 0.398 | 13.11 | 0.593 | 0.631 | 50.27 |
| 14B | CD-LAM | 29.87 | 23.18 | 0.814 | 0.342 | 13.03 | 0.597 | 0.617 | 33.22 |
FDCE 降幅 −42.3% (2B) / −25.9% (14B);迁移 FDCE 降幅 −20.9% / −33.9%。
一个值得注意的观察:baseline 的 FDCE 从 2B 到 14B 反而变差(34.00 → 40.29,迁移 42.74 → 50.27)。作者据此论证「scale 不能替代 debiasing」。另外迁移设定下的 PSNR 全都在 13 dB 左右——两个模型都低得离谱,说明迁移 rollout 在像素上跟参考基本对不上,那一栏的 PSNR/SSIM 差异不该被解读。
4.3 机器人动作 rollout(Stage 3,AgiBot n=300)— 主结果¶
| Backbone | Model | FDCE\(_\text{mean}\) ↓ | FDCE\(_\text{med}\) ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ | \(\mathrm{do}(u_t{=}0)\) ↓ | \(\mathrm{do}(u_t{=}u^{\mathrm{tar}}_t)\) ↓ |
|---|---|---|---|---|---|---|---|---|
| 2B | DreamDojo | 12.63 | 8.15 | 19.85 | 0.798 | 0.271 | 10.71 | 24.36 |
| 2B | CD-LAM | 8.24 | 6.75 | 20.60 | 0.806 | 0.269 | 5.03 | 22.55 |
| 14B | DreamDojo | 11.11 | 8.98 | 20.01 | 0.808 | 0.263 | 9.36 | 24.82 |
| 14B | CD-LAM | 7.73 | 5.99 | 21.01 | 0.818 | 0.247 | 2.18 | 21.11 |
FDCE\(_\text{mean}\) 降 −34.8% / −30.4%。注意两类干预的落差极大:
- 零动作干预:2B 10.71→5.03(−53%),14B 9.36→2.18(−77%)
- 目标动作迁移:2B 24.36→22.55(−7.4%),14B 24.82→21.11(−15.0%)
零动作那一列是「对着静止参考算的残余运动」,和 rollout 列不可比。最漂亮的那个数字(−77%)恰好是 \(\mathcal L_{\mathrm{zero}}\) 直接优化的量——见 §5.2 第 4 条。
Figure 4a:(a) 八个动作类别上的 FDCE 分解,说明收益不是集中在单一 primitive(附录的完整分解里 CD-LAM 在少数类别上与 baseline 持平或略输);(b) 2B 上整个 rollout 分布向低 FDCE、高 PSNR 移动。这两张图回答了「是不是靠个别样本拉出来的」,做得不错。
Figure 4:2B / 14B 下的定性 rollout。四行分别是 GT、DreamDojo、CD-LAM,所有模型行从同一初始帧出发、接收同一条机器人动作序列。DreamDojo 的机械臂位姿会从 GT 轨迹漂走,且 scale 到 14B 并不能修复这个漂移。
4.4 Debiasing 数据 scaling(2B)¶
| Model | PSNR ↑ | FDCE\(_\text{mean}\) ↓ | FDCE\(_\text{med}\) ↓ |
|---|---|---|---|
| DreamDojo | 19.85 | 12.63 | 8.15 |
| CD-LAM-1h | 20.54 | 8.91 | 6.88 |
| CD-LAM-10h | 20.61 | 8.87 | 6.23 |
| CD-LAM-100h(主结果用的档) | 20.60 | 8.24 | 6.75 |
| CD-LAM-1000h | 20.64 | 7.97 | 6.12 |
论文的读法:1h 档已经拿到 1000h 档 FDCE 改进的约 80%(3.72 / 4.66),所以收益主要来自 debiasing 本身而非数据规模。
但注意 FDCE\(_\text{med}\) 并不单调:6.88 → 6.23 → 6.75 → 6.12。主结果用的 100h 档在中位数上输给 10h 档。
4.5 Robot action adaptation 效率¶
Figure 5:14B 的 aligned-protocol 训练曲线。橙色虚线是 DreamDojo 参考(PSNR≈20.0、FDCE≈11.11,正好是 Table 4 里 DreamDojo-14B 那一行)。CD-LAM 在约 3k 步越过 FDCE 线、3–4k 步越过 PSNR 线,6k 时明显超过。「>12×」= 50k / 4k。注意图上只有一条 CD-LAM 曲线和一条水平线——没有 DreamDojo 在同协议下的训练曲线。
4.6 目标函数消融¶
| Objective | PSNR ↑ | FG-PSNR ↑ | Cam-shift x/y ↓ | FDCE ↓ |
|---|---|---|---|---|
| Full CD-LAM | 29.64 | 26.57 | 0.133 / 0.101 | 17.23 |
| w/o embodiment-centric weighting | 29.53 | 26.26 | 0.134 / 0.100 | 18.40 |
| w/o action-centric contrast | 29.64 | 26.57 | 0.134 / 0.101 | 19.07 |
| w/o zero-transition calibration | 29.31 | 26.48 | 0.637 / 0.637 | 16.10† |
†论文脚注:该变体 FDCE 更低,但过不了上游相机平移诊断,因此不解读为「更好的去偏」。
(该表用的是独立的 ablation 评测设置,绝对值与 Table 4 不可比。)
5. 引申问题 / 讨论¶
说明:下面 §5.2 有相当一部分证据来自 arXiv 源码包里未被编译进最终 PDF 的文件——
sections/07_limitations.tex(在main.tex里被注释掉)、sections/08_appendix_bak.tex,以及十余个未被\input的_tab_*.tex/_fig_*.tex草稿片段。这些文件里保留了作者之间的内部批注(\cnote{}宏)和被删掉的对照实验。它们不是最终论文的主张,但能说明作者知道什么、以及最后选择呈现什么。
5.1 做得好的地方¶
-
问题定位是对的,而且定位方式很干净。 「LAM 训练时 \(z_t\) 是转移摘要,ACWM 部署时 \(z_t\) 是干预 handle」——这个角色切换的观察本身就值回票价。更重要的是他们把诊断放在了正确的位置:不是去看 rollout 好不好看,而是直接审计 encoder \((o_t,o_{t+1})\mapsto z_t\),三个诊断(重复帧、合成平移、episode shortcut)各自对应式 (5) 里的一个因子。0.527 → 0.043 这种量级的变化是实打实的。
-
PSNR 和 action following 的解耦证据(\(R^2=0.14\))是全文最硬的一块。 这不是在证明 CD-LAM 好,而是在证明整个领域的评测方式有问题——一个模型可以照抄 context 拿到漂亮 PSNR 而完全不听指令。这个结论独立于 CD-LAM 是否成立,对社区更有价值。
-
FDCE 的设计考虑了对抗自己的情况。 锚点种在腐蚀过的前景 mask 内、低可见度轨迹在打分前丢弃、对称 Chamfer 只算位移几何而不奖励点数匹配。作者明确写了已知失败模式(遮挡、运动模糊、无纹理夹爪上的 tracker 漂移)是 tracker-limited,且会同时抬高所有被比模型在同一 clip 上的分数,因此偏向 null。这种「我的指标怎样会对我不利」的自我审视不常见。
-
保留性检查做对了。 报 shortcut leakage 从 0.151 掉到 0.014 的同时,报「同 primitive 跨 episode 的 cosine 基本不变(0.132 → 0.131)」——这直接排除了「去偏 = 把整个 latent 空间压塌」这个最廉价的作弊解释。很多做表征去偏的论文缺这一步。
-
「scale 不能替代 debiasing」这个负面结果讲得很有分量。 baseline 的 FDCE 从 2B 到 14B 变差(34.00 → 40.29),FDCE\(_\text{med}\) 在 Stage 3 也从 8.15 变差到 8.98。这说明更大的 backbone 买到的是视觉能力而不是可控性——是个对领域有校准作用的观察。
-
接口不变这一点是工程上的正确选择。 ACWM 架构、latent 维度、conditioning 格式全都不动,只换 LAM 的 latent 空间。这让「所有差异都归因于 LAM 去偏」这个论证在原理上站得住(虽然实践上有 §5.2 第 3 条的问题)。
5.2 做得不够好的地方 / 值得质疑的地方¶
-
论文没有 Limitations 章节——它被从编译中删掉了。
main.tex第 254 行是% \input{sections/07_limitations}。而那个文件里躺着四段限制说明和四条作者内部批注,其中一条明确写着:「两个审稿人一定会期待但现在缺失的限制:(1) CD-LAM 的额外监督(SAM3 mask、粗 primitive 标签)及其成本与失败模式;(2) 所有证据都是 world-model rollout——还没有任何 policy learning 或真机闭环控制结果」,后面还附了准备补写的草稿文字。最终的处理方式是:草稿没被补进去,整节被删掉。 -
「>12× fewer updates」这个 headline 的对比口径是混的。 实验设置里两句话直接打架:先说「在所有效率对比中,步数都是 aligned protocol 下的 optimizer update,两个模型用同样的数据、batch、优化器设置,所以步数可直接比较」,紧接着说「Fig. 1(c) 里的 50k 参考和 Fig. 5 的虚线是 DreamDojo 的完整原始预算」。也就是说:分子(CD-LAM 3k/6k)在 aligned protocol 下,分母(50k)不在。Figure 5 里也只有一条 CD-LAM 曲线撞一条水平线——没有 DreamDojo 在同协议下的训练曲线。被删掉的 limitations 恰恰写明了这一点:「我们还没跑的对照是在完全相同配方和预算下重训一个 DreamDojo」,并且旁边的内部批注写道:「这段看起来过时了:Table 4 现在有 DreamDojo-14B 在 aligned protocol 下的行——如果那个 run 存在,这段就在拆你自己的台;如果不存在,表格需要加脚注。二选一,把它解决掉。」最终既没解决也没加脚注,而是删了整节。
-
训练目标和评测指标共用同一个前景分割器。 \(\mathcal L_{\mathrm{emb}}\) 用 SAM3 mask 给重建加权,FDCE 用 SAM3 mask 选前景再跟踪。CD-LAM 被训练去「在 SAM3 认定的前景区域上重建得更准」,然后被「在 SAM3 认定的前景区域上的位移误差」评判,而 baseline 从头到尾没见过 SAM3。这不是致命的(FDCE 比的是位移几何不是像素),但它是一条从训练信号直通评测信号的通道,论文完全没有讨论。最小的对照是:给 DreamDojo 的 LAM 也做一次同等步数的前景加权重建微调,看能吃掉多少 gap。
-
最亮眼的干预数字,恰好是训练目标直接优化的那个量。 14B 的零动作干预 9.36 → 2.18(−77%)是全文最抢眼的数字,也是 Figure 1 叙事的落点。但 \(\mathcal L_{\mathrm{zero}}\) 做的事就是把 \(\|\mu_\phi(o_t,o_t)\|\) 压到接近零,Stage 2 让 ACWM 学会「近零 latent ⇒ 不动」,Stage 3 的 bridge 把 \(u=0\) 映到近零 latent。整条链路是被显式安装进去的,不是涌现的可控性。真正独立的检验是目标动作迁移,而那一栏只有 −7.4% / −15.0%——比零动作弱一个数量级。论文把两者并列呈现,但它们的证据强度完全不同。
-
被删掉的草稿里有一张表显示:零动作优势在 100h/1000h 档上会翻转。
_tab_zeroaction.tex(未编译)报的是 n=20 trend subset 上的零动作静止探针:DreamDojo 10.71 mean / 3.62 med;CD-LAM-1h 4.55 / 1.19;10h 4.58 / 1.68;100h 11.08 / 4.85(比 baseline 差);1000h 8.65 / 6.58(中位数比 baseline 差)。而论文主结果用的正是 100h 档,Table 4 里 2B 的零动作是 5.03。两处数字对不上(协议和 n 都不同),但方向性的问题是实在的:在作者自己算过的某个设定下,零动作优势属于 1h/10h 小档位,到 100h/1000h 就没了甚至反转。另外 14B 的 2.18 在两张表里逐字相同,而同一列的 DreamDojo-14B 从 10.44 变成 9.36——两个数字来自不同的评测批次却被放进同一列。 -
被删掉的附录里有作者自己算的 bootstrap 置信区间,结论是主档位不显著。
08_appendix_bak.tex(未编译)写道:clip-level bootstrap(4000 次重采样,n≈300),「CD-LAM-1h 的 mean FDCE gap 是 −4.0 px(95% CI [−5.8, −2.3]),10h 是 −2.8 px([−4.7, −0.8]),都不含零。更大的 100h/1000h 档落在 baseline 的 CI 之内——mean gap 分别是 +0.5 和 −0.7 px,95% CI 为 [−1.6, 2.7] 和 [−2.6, 1.2],都跨过零——所以它们与 DreamDojo 没有显著差异」。那是在另一套评测协议下算的(数字与最终 Table 4 对不上),但事实是:这个团队做过不确定性分析,发现主档位不显著,最终论文里没有任何一个置信区间、误差棒或显著性检验。 -
Table 5 的「isolates data quantity at fixed compute」这句话,与作者自己的 exposure 账本矛盾。 该表 caption 声称「所有档位共享同样的 1k 步 Stage-1 预算,因此比较隔离了数据量」。但固定步数、增大语料,必然意味着 epochs-over-corpus 在下降——1h 档在 1k 步里把它的数据看了几百遍,1000h 档连一遍都不到。被删的 limitations 第一段就写:「我们不把 1h/10h 阶梯读作数据效率排序:这些档位的 world-model exposure 不同」,被删的附录更把这条上升为「本文的核心记账纪律是:一个训练步是算力单位,不是模型实际看了多少含动作视频,所以我们从不孤立地报告步数」,并给了具体数字(10h WM 在 step 2000 达到 1.559× strict frame-token coverage,100h WM 同一步只有 0.473×,差 3.3×)。内部批注也点名了这处矛盾。最终论文的处理是:删掉纪律,保留「1h 已拿到 80% 收益」的数据效率解读,再给表加一句「隔离了数据量」的 caption。而唯一一个真正固定 world model 的对照(
_tab_lessmore.tex,100h vs 1000h LAM)显示两者完全打平(encoded PSNR 24.90 vs 24.90,official PSNR 22.84 vs 22.84)——这张表也被删了。 -
Stage 3 的 bridge 拟合质量很差,而且这个数字被删了。 被删附录写:「action-to-latent 的拟合仍是瓶颈,a2z \(R^2 \approx 0.28\),我们如实报告:bridge 证明的是真实动作可以部分进入同一 \(z\) 空间,不是这个映射很紧」。\(R^2=0.28\) 意味着机器人动作只解释了目标 latent 28% 的方差——而整个 Stage 3、以及全部真机动作 following 结果,都建立在这个映射上。最终论文对 bridge 的描述只有一句「a lightweight MLP bridge \(g_\eta\) is trained to regress the gradient-stopped CD-LAM latent」,没有任何拟合质量指标。
-
Bridge 在 6 个 embodiment 里有 2 个是负的,主结果用的那个是最弱的「可用」档。
_tab_bridge.tex(未编译):RoboTwin 20D +2.41 dB「usable」、AgiBot-β 20D +1.26「usable」、AgiBot-β 22D +1.07「usable」、AgiBot Alpha 20D +0.71「weak-positive」、DROID 20D −0.16「negative」、Galaxea 20D −0.30「negative」。主结果跑在 AgiBot 上。一个宣称要解决跨 embodiment 数据瓶颈的方法,其动作接入模块在三分之一的 embodiment 上失效——这是核心信息,完全没进论文。 -
被删附录还记录了一个与「non-collapsed」主张直接冲突的测量。 Stage 3 的联合训练把 latent 的 per-dimension std 从 0.860 降到 0.474、participation ratio 从 18.83 降到 8.97(有效维度腰斩),同时把 robot-identity 线性探针准确率从 0.418 抬到 0.522。作者自己的判语是「更 robot-specific 的 \(z\) 会改善源机器人的 bridge 拟合,但这是跨机器人迁移风险的警示信号」。而论文正文反复强调 calibration 的作用是「calibrated non-collapsed latent action representations」——有效维度掉一半这件事没有出现在最终版本里。
-
消融表里,被称为「dominant」的那一项让 headline 指标变差。 去掉 zero-transition calibration,相机平移响应从 0.133/0.101 涨到 0.637/0.637(4.8×/6.3×,确实是它在管这件事),但 FDCE 反而从 17.23 降到 16.10(更好)。论文加脚注说「不解读为更好的去偏」。这个处理不算不诚实,但它暴露了一个真问题:三个目标里最重要的那个,在下游 action-following 指标上是负贡献。此外「w/o action-centric contrast」那一行的 PSNR 和 FG-PSNR 与完整模型逐位相同(29.64 / 26.57),论文只说「identical at reported precision」——两个指标同时精确相同,更像是那两列没有为这一行重新测量。
-
「Causal」是一层修辞包装,不是技术内容。 全文没有 SCM、没有可识别性结果、没有 do-calculus 推导。式 (5) 只是 \(z\approx f(A,C,V)\) 加一句「目标函数没有阻止 \(z\) 依赖 \(C,V\)」。三个损失分别是:mask 加权重建、带标签的 SigLIP 成对损失、free-bits KL + 范数 margin——都是标准表征学习技术。更有意思的是:草稿里原本有一句诚实的免责声明「This is an operational causal view, not an identification claim: we do not assume the true physical action is recoverable from pixels」,在最终版被注释掉了(
03_interface.tex第 12 行)——免责声明删了,因果措辞留着。 -
对比学习引入了 caption 监督,这动摇了「从无标注视频 scale」的动机。 \(\mathcal L_{\mathrm{ctr}}\) 需要 clip caption 里的动词。论文的辩护是「只是 verb-level,不含 controller state,所以没变成有监督的机器人动作学习」——这个辩护成立,但没回答真正的问题:Ego4D / EgoExo4D 有 caption,随手抓的网络视频没有。而且覆盖率只有 36.6%,一个 batch 的有效 primitive 只有 8–10 类。LAM 存在的理由就是「人类视频便宜」,现在这条路上多了一个标注依赖。
-
只有一个 baseline,而且是 pipeline 的宿主。 全文唯一对比对象是 DreamDojo。同期直接相关的工作——ConLA(对比式 latent action,2026-02)、AdaWorld、Moto、IGOR——一个都没有实验对比。尤其是 ConLA,名字里就写着 contrastive latent action,与本文的 \(\mathcal L_{\mathrm{ctr}}\) 高度重合,只在 related work 里被引用了一次。
-
「efficient」的账没算完。 12× 只统计 Stage 3 的 optimizer update,不含 Stage 1(1k 步)和 Stage 2(2k 步),也不含 SAM3 在整个语料上跑 mask 的开销、caption 动词抽取与聚类的开销。全文跑在 96 张 H100 上却没有报任何 GPU-hour 或 wall-clock。对一篇把 efficiency 写进摘要和 Figure 1 的论文,这是应该给的数字。
-
完全没有 policy learning 或闭环控制结果。 所有证据都是 world-model rollout 与像素/轨迹指标。ACWM 的价值主张是 planning、policy evaluation、data augmentation——三个都没测。这条恰好是被删 limitations 里那条内部批注点名的第二项。
5.3 值得继续探讨的方向¶
-
把被删的对照实验补回来,就是最好的下一篇。 优先级排序:(1) 在同一 aligned protocol 下重训 DreamDojo 的 Stage 3,给出真正的双曲线效率对比;(2) 恢复 clip-level bootstrap CI,让 100h 档的显著性问题有个明确答案;(3) 补上「DreamDojo latent + 同一 bridge」这个被作者自己标记为 unverified missing baseline 的 cell。这三件事做完,这篇论文的结论强度会完全不同。
-
解开指标与训练信号的耦合。 用一个与训练时不同的分割器(SAM2、或人工标注的 mask)重算 FDCE;同时给 DreamDojo 的 LAM 做等步数的前景加权重建微调作为「便宜版 CD-LAM」对照。如果 gap 大部分被吃掉,那真正起作用的是前景加权而不是「因果去偏」。
-
把 \(\mathcal L_{\mathrm{zero}}\) 从评测里摘出去。 零动作那一列既然是训练目标的直接产物,就该当成 sanity check 报告,而把 action-following 的主张压在目标动作迁移和一个新的、训练时没见过的干预类型上(例如动作幅度缩放 \(\mathrm{do}(u_t = \alpha u_t)\),检验 latent 空间是否有正确的尺度语义,而不只是方向)。
-
a2z \(R^2 = 0.28\) 是最值得追的技术问题。 只解释 28% 方差还能拿到这些结果,说明 ACWM 对 latent 的精度并不敏感,或者 latent 里剩下的 72% 本来就不该由动作决定。做一个 \(R^2\) 与下游 FDCE 的关系曲线,能直接回答「latent 空间的干净程度」和「bridge 拟合质量」哪个才是真瓶颈。
-
跨 embodiment 才是这套方法的真正考验。 DROID 和 Galaxea 上 bridge 为负这件事需要一个解释。是动作空间维度不匹配、控制频率不同、还是 latent 空间已经过拟合到 AgiBot?被删附录里 robot-identity 探针从 0.418 涨到 0.522 已经给了一个假说,值得正面做实验。
-
participation ratio 腰斩需要被修复而不是被隐藏。 既然 calibration 的设计初衷就是 non-collapse,那 Stage 3 联合训练把有效维度从 18.83 压到 8.97 是个设计缺陷。可以试:Stage 3 冻结 LAM 的同时给 bridge 加一个 latent 分布匹配项(例如对齐 \(g_\eta(u)\) 与 \(\mu_\phi\) 的协方差谱)。
-
和 ConLA / Moto / IGOR 正面比。 尤其 ConLA,思路重合度最高。如果 CD-LAM 的三项里只有对比学习那一项在起作用,那这篇的贡献叙事需要重写。
-
验证 ACWM 真的能当模拟器用。 最有说服力的下游实验是:用 debiased ACWM 做 policy evaluation,看它对策略的排序是否与真机排序一致(类似 SIMPLER 的 real-to-sim 相关性分析)。FDCE 降 30% 如果换算不出排序相关性的提升,那这个指标本身的价值也要打问号。
-
粗动词标签能不能自举掉。 现在依赖 caption。可以试用 LAM 自身的 latent 做聚类得到伪 primitive,迭代式地自监督——如果成立,「需要 caption」这个软肋就消失了,方法才真的能 scale 到无标注视频。
参考资源¶
- 论文 PDF: paper.pdf
- LaTeX 源码: source/ — 注意
sections/07_limitations.tex与sections/08_appendix_bak.tex未被编译进最终 PDF,内含作者内部批注与被删对照实验 - 代码 / 项目页 / 模型: GitHub · Project Page · HuggingFace
- 关键 baseline / 相关论文:
- DreamDojo — Gao, Liang, Zheng, ..., A Generalist Robot World Model from Large-Scale Human Videos(唯一 baseline,也是 pipeline 宿主)
- AdaWorld — Gao, Zhou, Du, Zhang, Gan, ICML 2025(同一位一作,latent action 作为可迁移 condition)
- Genie — Bruce et al., 2024(离散 latent action codebook 的开山工作)
- LAPO — Schmidt & Jiang;LAPA — Ye et al.
- What Do Latent Action Models Actually Learn? — Zhang, Pearce et al., NeurIPS 2025
- Latent Action Learning Requires Supervision in the Presence of Distractors — Nikulin et al., ICML
- ConLA — Dai et al., arXiv 2602.00557(对比式 latent action,同期最相关但未做实验对比)
- SAM 3 — Carion et al.;CoWTracker — Lai, Insafutdinov, Sucar, Vedaldi, arXiv 2602.04877
- EgoDex — Hoque et al., arXiv 2505.11709;AgiBot World Colosseo — AgiBot-World-Contributors et al.
- MotionPro — 2025(ObjMC,FDCE 的思想来源)