跳转至

Being-H0.7: A Latent World-Action Model from Egocentric Videos

论文阅读笔记 — 用于后续讨论的概览

Being-H 系列第三代。前作 Being-H0.5 (2601.12993),系列脉络见 BeingBeyond 系列总览


1. 基础信息

  • 题目: Being-H0.7: A Latent World-Action Model from Egocentric Videos
  • 作者: Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu — BeingBeyond(智在无界)+ 北京大学
  • arXiv 编号: 2605.00078(submitted 2026-04)
  • 项目页: https://research.beingbeyond.com/being-h07
  • 关键词: latent world-action model, latent reasoning space, prior-posterior alignment, dual-branch training, flow matching, MoT, V-JEPA2.1, anti-collapse regularization

teaser Figure 1:Being-H0.7 的一句话定位 —— 把 world model 的「预测未来」收益拿到,但不在推理时生成任何未来帧

2. 文章介绍

2.1 解决的领域和问题

这篇处在 VLAworld-action model 两条路线的交叉口,要同时解决两边的病:

  • 纯 VLA 的病:动作监督是稀疏的,模型容易学出 shortcut mapping(从观测直接抄近路到动作),而不是真正表征动力学、接触和任务进度。
  • video-generative world model 的病:用密集像素预测来捕捉未来演化,但像素空间是控制的昂贵且间接的底座 —— 会建模大量与动作无关的视觉细节,训练/推理开销都很大。对「接飞过来的球」「传送带交互」这类动态任务,每个控制步都 rollout 未来帧的延迟是致命的。

2.2 Motivation

论文的核心论断非常干净:

关键不是在这两个范式之间二选一,而是用一个 latent reasoning space 把它们连起来 —— 一个显式的中间空间,让「与未来相关的、面向动作的信息」在生成低层动作之前先被组织好。

这实际上是在问:world model 的收益到底来自哪里? 如果来自「模型内部形成了对未来的预期」,那就没必要真的把未来画出来 —— 只要在训练时用未来信息塑造那个内部表征,推理时就可以把生成未来的那条路整个扔掉。

2.3 之前工作的问题

类别 代表工作 缺陷
标准 VLA π₀, π₀.₅, Being-H0.5 直接映射观测→动作,不显式建模世界如何演化;稀疏动作监督鼓励 shortcut
视频生成式 world-action model DreamZero, Cosmos Policy, LingBot-VA 像素空间预测昂贵且与物理动力学的抽象层级不匹配;测试时 rollout 引入延迟与显存开销
保留视频协同训练但去掉测试时生成 Fast-WAM (2603.16666) 方向正确(本文最接近的对手),但仍依赖显式视频监督
未来表征监督 / 隐状态对齐 DreamVLA, JALA (2602.21736) 各自只做了一部分:多重未来表征监督、或动作侧隐状态与未来查询状态对齐

2.4 论文解决方案(一句话)

在 perception 和 action 之间插入 \(K\) 个可学习 latent query 构成「潜在推理空间」,训练时用一条只在训练期存在的 posterior 分支(把 latent query 换成未来观测的编码)与 prior 分支做逐层隐状态对齐,逼 prior 分支学会仅凭当前观测就推理出 future-aware 结构;推理时直接丢掉 posterior 分支,不做任何视觉 rollout

2.5 与前序工作的关系

  • 直接建在 Being-H0.5 之上:沿用 MoT 架构(Understanding Expert + Action Expert)、UniHand 2.0 的统一序列格式、以及 UAC 部署机制。
  • Backbone:Understanding Expert 用 InternVL3.5,Action Expert 换成 Qwen3;视觉编码器统一用 V-JEPA2.1(context 和 future 两侧共用,保证嵌入空间一致,context 侧可训练)。
  • 与自家 JALA(2602.21736)互补:JALA 做的是「动作侧隐状态与未来查询状态对齐」用于人类视频预训练;H0.7 把类似思路做成了通用的 prior-posterior 双分支架构
  • 主要对手 Fast-WAM(本站也有 笔记)——同样主张「训练时用未来、推理时不生成未来」,但 Fast-WAM 靠视频协同训练,H0.7 靠潜在空间对齐。

3. 方法介绍

intuition Figure 2:左 —— 可学习 latent query 插在多模态上下文与噪声动作之间,随 transformer 逐层传播、渐进组织成面向动作的中间状态。右 —— prior/posterior 双分支联合对齐,让模型在推理时也能「带着未来信息思考」。

3.1 潜在推理空间

\(x\) 为指令、\(o_{-H:0}\) 为长度 \(H\) 的观测上下文、\(s\) 为状态,插入 \(K\) 个 latent query \(Q\in\mathbb{R}^{K\times d}\)

\[S = [\,x;\ o_{-H:0};\ s;\ Q;\ a_{0:T}\,]\]

这些 query 与指令、观测、状态、动作一起参与逐层 transformer 传播,渐进地把任务相关信息整合成面向动作的潜在状态,再反过来塑造动作生成。这样模型就不必强行把抽象多模态语义一步映射到密集低层动作。

但作者立刻指出:光有这个结构不保证未来预测会自发涌现。只用动作监督训练,latent 可能坍缩成弱中间表征,或只编码够解码局部动作的浅层线索。所以需要下一节的未来信息注入。

3.2 双分支设计与联合对齐

architecture Figure 3:两条分支被打包进同一条序列、一次前向。共享上下文 token 对两分支可见,但 prior 与 posterior 的分支专属 token 之间互相不可见(dual-branch attention mask),二者只通过对齐损失耦合。对应位置赋予相同 positional ID。

  • Prior 分支(可部署):动作生成只条件于当前指令、观测上下文、状态和可学习 latent query。
  • Posterior 分支(仅训练期):能看到未来观测 \(\tilde o_{0:T}\)。未来帧先经冻结的 ViT 编码,再由 Perceiver resampler 聚合成 \(K\) 个 future embedding:
\[z^{\text{post}} = E(\tilde o_{0:T})\in\mathbb{R}^{K\times d}\]

\(K\) 与 prior 分支的 latent query 数一致,两分支在潜在推理位置上结构对齐

两分支在动作监督下自然捕捉推理的两个视角:prior 学「先从当前上下文组织潜在推理状态、再生成动作」;posterior 则揭示哪些未来信息对动作决策真正有用

逐层对齐损失(作用在最后 \(L=9\) 层):

\[\mathcal{L}_{\text{align}}=\frac{1}{L}\sum_{\ell=1}^{L}\frac{1}{|h_\ell|}\left\|h_\ell^{\text{prior}}-h_\ell^{\text{post}}\right\|_F^2\]

3.3 Flow Matching 目标

两分支都用 flow matching。构造插值动作 \(a_t = ta+(1-t)\epsilon\)、目标速度 \(u_t = a-\epsilon\)

\[\mathcal{L}_{\text{FM}}=\underbrace{\left\|v_\theta^{\text{prior}}(a_t,c,q)-u_t\right\|_2^2}_{\text{prior}}+\underbrace{\left\|v_\theta^{\text{post}}(a_t,c,z^{\text{post}})-u_t\right\|_2^2}_{\text{posterior}}\]

3.4 抗坍缩正则(关键补丁)

隐状态对齐单独用会有 trivial solution(两边都塌到零/同一方向就能把 \(\mathcal{L}_{\text{align}}\) 压到 0)。所以加两项:

范数保持

\[\mathcal{R}_{\text{norm}}(h)=\left[\text{ReLU}(\tau-\|h\|_2)\right]^2\]

谱多样性(负谱熵,鼓励平坦谱、阻止方向坍缩):把某层一批 latent 隐状态投到随机 \(n\) 维子空间得 \(H\in\mathbb{R}^{M\times n}\),行归一化后算 Gram 矩阵 \(G=\hat H\hat H^\top\) 的特征值 \(\{\lambda_i\}\),归一化谱 \(p_i=\lambda_i/\sum_j\lambda_j\)

\[\mathcal{R}_{\text{rank}}(H)=\sum_{i=1}^{M}p_i\log p_i\]

最终目标:

\[\mathcal{L}=\mathcal{L}_{\text{FM}}+w_{\text{align}}\mathcal{L}_{\text{align}}+w_{\text{norm}}\mathcal{R}_{\text{norm}}+w_{\text{rank}}\mathcal{R}_{\text{rank}}\]

3.5 Implementation Details

模型规模 3B
视觉输入 RGB-only,context \(224\times224\)future frames \(256\times256\)
Understanding Expert InternVL3.5
Action Expert Qwen3
视觉编码器 V-JEPA2.1(两侧共用,context 侧可训练)
观测 horizon \(H=4\)
Action chunk \(T=20\)
Latent query 数 \(K=16\)
对齐层数 最后 \(L=9\)
损失权重 \(w_{\text{align}}=10^{-3}\)\(w_{\text{norm}}=w_{\text{rank}}=10^{-4}\)
Batch sequence packing,有效全局 batch ≈128 trajectory chunks
部署延迟 配合 UAC 达到 3–4 ms/step,显存与非 UAC 版本持平

post-training 时只保留动作目标 + 对齐损失,不用抗坍缩正则

4. 结果对比

4.1 六个仿真 benchmark 总表

Model Size LIBERO LIBERO-plus LIBERO-plus* RoboCasa-50 GR1 CALVIN CALVIN* RoboTwin2
π₀ 3B 94.4 53.6 42.4 3.92 65.9/58.4
π₀.₅ 3B 96.9 77.4 41.4 4.06 4.13 82.7/76.8
GR00T-N1.6 3B 93.9 36.0 47.6 4.60 4.24
X-VLA 0.9B 4.43 72.9/72.8
ABot-M0 4B 98.6 80.5 58.3 86.1/85.1
MINT-4B 4B 98.7 80.1 84.1 4.57
Being-H0.5 2B 98.9 78.5 83.1 53.5 4.63 4.48
— world model 类 —
DreamVLA 92.6 4.44
VLA-JEPA 96.1 79.5
LingBot-VA 5B 98.5 92.9/91.6
Cosmos-Policy 2B 98.5 67.1
Fast-WAM 6B 97.6 91.9/91.8
Being-H0.7 3B 99.2 82.1 84.8 62.1 49.2 4.67 4.48 90.2/89.6

关键读数:

  • RoboCasa 53.5 → 62.1(相对 Being-H0.5 +8.6pp)是最大的单项提升。
  • RoboTwin 2.0 的鲁棒性最亮眼:clean 90.2% → 重度域随机化 89.6%,只掉 0.6pp
  • RoboCasa 上仍输给 Cosmos-Policy 的 67.1%(一个 2B 的显式 world model),RoboTwin 上输给 LingBot-VA 和 Fast-WAM —— 论文没有回避,但也没深入讨论。

4.2 真机:三平台、12 任务、五个能力维度

平台:PND Adam-U(19 body DoF + 双 Linkerbot O6 手)、Unitree G1(26-DoF 上身接口 + AMO 做 50Hz 全身平衡后端)、Franka FR3(7-DoF + 单手)。

评测协议做得很规范:统一 black-box inference server,随机化被测 endpoint 与 rollout 顺序,操作员盲测、二值判定,每任务 20 trials。

real bars

能力维度 代表任务 结果
Dynamic Scene 接快速滚动的球、球拍改向、往移动容器倒液体、传送带交互 优势最大;最强 baseline 是 Fast-WAM(与其低延迟定位一致)
Motion Reasoning 轨迹预判、相对速度、接触时机 排序与 Dynamic Scene 基本一致
Physical Reasoning 移液管转移、漏斗倒液、叠衣、鞋楦插入、锤钉 最接近的 baseline 是 Being-H0.5
Long Horizon 装鞋盒等多阶段 同上
Generalization 布局/层高/容器/物体实例/相机几何变化 跨本体保持提升

Being-H0.7 五个 suite 全部领先。作者强调这个「提升遍布整个 benchmark 而非集中在某个角落」才是真机部分的主要结论。

4.3 推理成本

inference cost

配合 UAC 后 Being-H 变体进入 3–4 ms/step,且显存与非 UAC 版本持平 —— 这是相对显式 world model 的核心卖点:拿到了预测性收益,没有付出 rollout 的代价。

5. 引申问题 / 讨论

5.1 做得好的地方

  1. 问题 framing 是这一系列里最漂亮的一次。"world model 的收益是否必须以生成像素为代价" 这个问题问得极准,而且答案(训练时注入未来、推理时丢弃)在方法论上是干净的 —— 它把 world model 从「一个要跑的模块」降级成「一种训练信号」。这个思路的普适性远超本文,可以套到任何有「训练时可获得特权信息」的场景。

  2. prior/posterior 的结构对齐设计考虑得很细。两分支不是简单地跑两次前向:打包进同一条序列一次前向、用 dual-branch attention mask 隔离、给对应位置赋予相同 positional ID 保证结构匹配 —— 最后一条尤其容易被忽略,没有它两组 token 在 RoPE 下就不在同一个「相位」上,对齐损失会退化。

  3. 主动识别并修补了 trivial solution。隐状态 L2 对齐天然有坍缩解,作者不是等审稿人指出来,而是直接上了范数保持 + 谱熵正则。用负谱熵度量方向多样性比常见的余弦相似度惩罚更根本 —— 它约束的是整个 Gram 谱的平坦度,而不只是两两之间。

  4. 真机评测协议是本系列最严格的一次:黑盒 inference server 统一执行栈、随机化 endpoint 与顺序、操作员盲测。相比 Being-H0 那种「20 trials 报个数」进步巨大,而且这套协议本身就是对自家 Rethink-VLA 提出的 Grouped Blind Ensemble 的落实 —— 说明公司内部的方法论批评真的被产品线吸收了。

  5. 能力导向的 suite 划分(dynamic / physical / motion / long-horizon / generalization)比任务列表更有信息量,而且是 compositional 的(一个任务可带多个标签)。尤其 Dynamic Scene 这一组直接对应「为什么需要 future-aware」的假设 —— 结果也确实在这组上优势最大,假设与验证是闭环的

  6. 老实承认 Fast-WAM 在反应型任务上是最强 baseline,并把原因归到它的低延迟定位上。没有把对手写成稻草人。

5.2 做得不够好 / 值得质疑的地方

  1. 最该做的消融没有做:\(\mathcal{L}_{\text{align}}\) 到底贡献了多少? 全文的核心主张是「未来信息通过对齐塑造了 latent 空间」,那么最关键的对照就是「有 latent query 但 \(w_{\text{align}}=0\)」—— 即只保留潜在推理空间、不注入任何未来信息。如果这个 baseline 也能拿到大部分收益,那论文的故事就要重写成「插入 latent query 增加了有效深度」而非「latent world model」。我在正文和实验章节里没有找到这个对照。同样缺失的还有 \(K\)(16)、\(L\)(9)、\(w_{\text{align}}\)\(10^{-3}\))的 sensitivity。

  2. 「不生成未来帧」的效率优势被过度宣传了。3–4 ms/step 这个数字主要来自 UAC(继承自 Being-H0.5),而不是「不做 rollout」本身。图里也是 "UAC-enabled Being-H variants" 进入这个区间。真正该报的是「同架构 + 显式未来帧生成」vs「本方法」在同一部署栈下的延迟差 —— 没有这个对照,读者无法把效率收益归因给核心贡献。

  3. posterior 分支的训练开销没有报告。虽然打包进一条序列,但序列长度实实在在多了 \(K=16\) 个 token 加一整套未来帧编码(\(256\times256\) 的 ViT 前向 + Perceiver)。训练时间/显存相对单分支增加多少?对一个把「训练效率」作为对比 world model 卖点的工作,这是必须交代的。

  4. RoboCasa 上输给 Cosmos-Policy(62.1 vs 67.1)动摇了核心论点。Cosmos-Policy 是 2B 的显式 world model,比 H0.7 的 3B 还小,却在 RoboCasa 上高 5pp。这个反例直接挑战了「像素预测是昂贵且间接的底座」的论断 —— 至少在这个 benchmark 上,显式未来生成买到了本方法买不到的东西。论文把它列在表里但没有一句分析。RoboTwin 上输给 LingBot-VA / Fast-WAM 也是同理。

  5. latent 可视化(vis_v0.pdf)在正文里几乎没有解读。既然核心主张是「latent 编码了 future-aware、action-useful 结构」,那这张图本该是全文最重要的证据 —— 应该展示 latent 在接触前/接触时/接触后如何变化、能否解码回未来场景的粗略结构、在动态任务上是否真的在跟踪物体运动。现在只有一个图注「Visualization of the Latent Reasoning」,等于把最关键的机理证据浪费掉了。

  6. 换了 Action Expert backbone(Qwen3)和视觉编码器(V-JEPA2.1)两个变量。相对 Being-H0.5(Action Expert 未特别说明、视觉走 InternVL3.5 自带),H0.7 同时换了这两个组件。V-JEPA2.1 本身就是个强自监督视频表征模型,「用了 V-JEPA 特征」和「做了 prior-posterior 对齐」的贡献无法分离 —— 而这两件事恰好都是「让表征带上时序/预测结构」,高度可替代。

  7. 未来观测用 \(256\times256\) 而 context 用 \(224\times224\) 这个不对称没有解释。posterior 分支看到的是更高分辨率的未来 —— 这让对齐任务对 prior 分支更难(要从低分辨率当前帧匹配高分辨率未来的编码),也可能相反地引入了尺度不匹配。这个选择需要一句话说明。

  8. 对齐只作用在最后 9 层,但 §3.1 的论证是「latent query 随逐层传播渐进组织信息」。如果渐进组织是核心机制,为什么只对齐末端?前面若干层的 latent 是否已经偏离?这里的设计与叙事有轻微脱节。

  9. 仍然没有摆脱 LIBERO 饱和问题:99.2% vs Being-H0.5 的 98.9%、MINT 的 98.7% —— 在这个区间报小数点后一位已经没有意义,而 BeTTER(自家 2604.18000)恰恰论证了静态 benchmark 会掩盖表征退化。好在本文加入了 LIBERO-plus 和 RoboTwin-Hard 这类扰动 benchmark,部分对冲了这个问题。

5.3 值得继续探讨的方向

  • 把 posterior 换成更强的特权信息:现在 posterior 只看未来 RGB。如果换成未来的接触力/触觉序列(对接 TTP 2607.01067)、或未来的物体 6D 位姿、或人类演示的完整轨迹,latent 会被塑造成什么样?这是 privileged-information distillation 在具身领域最自然的展开。
  • latent 空间的可解释性研究:训一个 decoder 把 latent 解回粗粒度未来场景,验证它到底编码了什么。这既是机理证据,也可能变成一个免费的「模型在想什么」的可视化工具。
  • prior-posterior 的差距能否当作不确定性信号\(\|h^{\text{prior}}-h^{\text{post}}\|\) 在训练时可算,推理时算不了 —— 但可以训一个小 head 去预测这个差距,作为 out-of-distribution 检测或 ask-for-help 触发器(跟 MPG 的 gate 是同一类思路,可以合并)。
  • 对齐层数与深度的关系:把对齐从最后 9 层推广到全层、或做成层数递增的 curriculum,验证 §3.1 的「渐进组织」叙事。
  • 与显式 world model 的融合而非对立:既然 Cosmos-Policy 在 RoboCasa 上更强,一个自然的问题是能否训练时同时做像素预测和 latent 对齐、推理时只留 latent —— 这其实就是 Fast-WAM 与 H0.7 的合体。
  • 动态任务的时间尺度上限:接滚动球已经很难,但 chunk \(T=20\)、观测 horizon \(H=4\) 意味着模型的「预见窗口」有限。在需要秒级预判的任务(抛接、动态避障)上这个窗口够不够?

参考资源