Being-H0.7: A Latent World-Action Model from Egocentric Videos¶
论文阅读笔记 — 用于后续讨论的概览
Being-H 系列第三代。前作 Being-H0.5 (2601.12993),系列脉络见 BeingBeyond 系列总览。
1. 基础信息¶
- 题目: Being-H0.7: A Latent World-Action Model from Egocentric Videos
- 作者: Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu — BeingBeyond(智在无界)+ 北京大学
- arXiv 编号: 2605.00078(submitted 2026-04)
- 项目页: https://research.beingbeyond.com/being-h07
- 关键词: latent world-action model, latent reasoning space, prior-posterior alignment, dual-branch training, flow matching, MoT, V-JEPA2.1, anti-collapse regularization
Figure 1:Being-H0.7 的一句话定位 —— 把 world model 的「预测未来」收益拿到,但不在推理时生成任何未来帧。
2. 文章介绍¶
2.1 解决的领域和问题¶
这篇处在 VLA 和 world-action model 两条路线的交叉口,要同时解决两边的病:
- 纯 VLA 的病:动作监督是稀疏的,模型容易学出 shortcut mapping(从观测直接抄近路到动作),而不是真正表征动力学、接触和任务进度。
- video-generative world model 的病:用密集像素预测来捕捉未来演化,但像素空间是控制的昂贵且间接的底座 —— 会建模大量与动作无关的视觉细节,训练/推理开销都很大。对「接飞过来的球」「传送带交互」这类动态任务,每个控制步都 rollout 未来帧的延迟是致命的。
2.2 Motivation¶
论文的核心论断非常干净:
关键不是在这两个范式之间二选一,而是用一个 latent reasoning space 把它们连起来 —— 一个显式的中间空间,让「与未来相关的、面向动作的信息」在生成低层动作之前先被组织好。
这实际上是在问:world model 的收益到底来自哪里? 如果来自「模型内部形成了对未来的预期」,那就没必要真的把未来画出来 —— 只要在训练时用未来信息塑造那个内部表征,推理时就可以把生成未来的那条路整个扔掉。
2.3 之前工作的问题¶
| 类别 | 代表工作 | 缺陷 |
|---|---|---|
| 标准 VLA | π₀, π₀.₅, Being-H0.5 | 直接映射观测→动作,不显式建模世界如何演化;稀疏动作监督鼓励 shortcut |
| 视频生成式 world-action model | DreamZero, Cosmos Policy, LingBot-VA | 像素空间预测昂贵且与物理动力学的抽象层级不匹配;测试时 rollout 引入延迟与显存开销 |
| 保留视频协同训练但去掉测试时生成 | Fast-WAM (2603.16666) | 方向正确(本文最接近的对手),但仍依赖显式视频监督 |
| 未来表征监督 / 隐状态对齐 | DreamVLA, JALA (2602.21736) | 各自只做了一部分:多重未来表征监督、或动作侧隐状态与未来查询状态对齐 |
2.4 论文解决方案(一句话)¶
在 perception 和 action 之间插入 \(K\) 个可学习 latent query 构成「潜在推理空间」,训练时用一条只在训练期存在的 posterior 分支(把 latent query 换成未来观测的编码)与 prior 分支做逐层隐状态对齐,逼 prior 分支学会仅凭当前观测就推理出 future-aware 结构;推理时直接丢掉 posterior 分支,不做任何视觉 rollout。
2.5 与前序工作的关系¶
- 直接建在 Being-H0.5 之上:沿用 MoT 架构(Understanding Expert + Action Expert)、UniHand 2.0 的统一序列格式、以及 UAC 部署机制。
- Backbone:Understanding Expert 用 InternVL3.5,Action Expert 换成 Qwen3;视觉编码器统一用 V-JEPA2.1(context 和 future 两侧共用,保证嵌入空间一致,context 侧可训练)。
- 与自家 JALA(2602.21736)互补:JALA 做的是「动作侧隐状态与未来查询状态对齐」用于人类视频预训练;H0.7 把类似思路做成了通用的 prior-posterior 双分支架构。
- 主要对手 Fast-WAM(本站也有 笔记)——同样主张「训练时用未来、推理时不生成未来」,但 Fast-WAM 靠视频协同训练,H0.7 靠潜在空间对齐。
3. 方法介绍¶
Figure 2:左 —— 可学习 latent query 插在多模态上下文与噪声动作之间,随 transformer 逐层传播、渐进组织成面向动作的中间状态。右 —— prior/posterior 双分支联合对齐,让模型在推理时也能「带着未来信息思考」。
3.1 潜在推理空间¶
设 \(x\) 为指令、\(o_{-H:0}\) 为长度 \(H\) 的观测上下文、\(s\) 为状态,插入 \(K\) 个 latent query \(Q\in\mathbb{R}^{K\times d}\):
这些 query 与指令、观测、状态、动作一起参与逐层 transformer 传播,渐进地把任务相关信息整合成面向动作的潜在状态,再反过来塑造动作生成。这样模型就不必强行把抽象多模态语义一步映射到密集低层动作。
但作者立刻指出:光有这个结构不保证未来预测会自发涌现。只用动作监督训练,latent 可能坍缩成弱中间表征,或只编码够解码局部动作的浅层线索。所以需要下一节的未来信息注入。
3.2 双分支设计与联合对齐¶
Figure 3:两条分支被打包进同一条序列、一次前向。共享上下文 token 对两分支可见,但 prior 与 posterior 的分支专属 token 之间互相不可见(dual-branch attention mask),二者只通过对齐损失耦合。对应位置赋予相同 positional ID。
- Prior 分支(可部署):动作生成只条件于当前指令、观测上下文、状态和可学习 latent query。
- Posterior 分支(仅训练期):能看到未来观测 \(\tilde o_{0:T}\)。未来帧先经冻结的 ViT 编码,再由 Perceiver resampler 聚合成 \(K\) 个 future embedding:
\(K\) 与 prior 分支的 latent query 数一致,两分支在潜在推理位置上结构对齐。
两分支在动作监督下自然捕捉推理的两个视角:prior 学「先从当前上下文组织潜在推理状态、再生成动作」;posterior 则揭示哪些未来信息对动作决策真正有用。
逐层对齐损失(作用在最后 \(L=9\) 层):
3.3 Flow Matching 目标¶
两分支都用 flow matching。构造插值动作 \(a_t = ta+(1-t)\epsilon\)、目标速度 \(u_t = a-\epsilon\):
3.4 抗坍缩正则(关键补丁)¶
隐状态对齐单独用会有 trivial solution(两边都塌到零/同一方向就能把 \(\mathcal{L}_{\text{align}}\) 压到 0)。所以加两项:
范数保持:
谱多样性(负谱熵,鼓励平坦谱、阻止方向坍缩):把某层一批 latent 隐状态投到随机 \(n\) 维子空间得 \(H\in\mathbb{R}^{M\times n}\),行归一化后算 Gram 矩阵 \(G=\hat H\hat H^\top\) 的特征值 \(\{\lambda_i\}\),归一化谱 \(p_i=\lambda_i/\sum_j\lambda_j\):
最终目标:
3.5 Implementation Details¶
| 项 | 值 |
|---|---|
| 模型规模 | 3B |
| 视觉输入 | RGB-only,context \(224\times224\),future frames \(256\times256\) |
| Understanding Expert | InternVL3.5 |
| Action Expert | Qwen3 |
| 视觉编码器 | V-JEPA2.1(两侧共用,context 侧可训练) |
| 观测 horizon | \(H=4\) |
| Action chunk | \(T=20\) |
| Latent query 数 | \(K=16\) |
| 对齐层数 | 最后 \(L=9\) 层 |
| 损失权重 | \(w_{\text{align}}=10^{-3}\),\(w_{\text{norm}}=w_{\text{rank}}=10^{-4}\) |
| Batch | sequence packing,有效全局 batch ≈128 trajectory chunks |
| 部署延迟 | 配合 UAC 达到 3–4 ms/step,显存与非 UAC 版本持平 |
post-training 时只保留动作目标 + 对齐损失,不用抗坍缩正则。
4. 结果对比¶
4.1 六个仿真 benchmark 总表¶
| Model | Size | LIBERO | LIBERO-plus | LIBERO-plus* | RoboCasa-50 | GR1 | CALVIN | CALVIN* | RoboTwin2 |
|---|---|---|---|---|---|---|---|---|---|
| π₀ | 3B | 94.4 | 53.6 | – | 42.4 | – | – | 3.92 | 65.9/58.4 |
| π₀.₅ | 3B | 96.9 | 77.4 | – | 41.4 | – | 4.06 | 4.13 | 82.7/76.8 |
| GR00T-N1.6 | 3B | 93.9 | – | – | 36.0 | 47.6 | 4.60 | 4.24 | – |
| X-VLA | 0.9B | – | – | – | – | – | 4.43 | – | 72.9/72.8 |
| ABot-M0 | 4B | 98.6 | 80.5 | – | – | 58.3 | – | – | 86.1/85.1 |
| MINT-4B | 4B | 98.7 | 80.1 | 84.1 | – | – | 4.57 | – | – |
| Being-H0.5 | 2B | 98.9 | 78.5 | 83.1 | 53.5 | – | 4.63 | 4.48 | – |
| — world model 类 — | |||||||||
| DreamVLA | – | 92.6 | – | – | – | – | – | 4.44 | – |
| VLA-JEPA | – | 96.1 | 79.5 | – | – | – | – | – | – |
| LingBot-VA | 5B | 98.5 | – | – | – | – | – | – | 92.9/91.6 |
| Cosmos-Policy | 2B | 98.5 | – | – | 67.1 | – | – | – | – |
| Fast-WAM | 6B | 97.6 | – | – | – | – | – | – | 91.9/91.8 |
| Being-H0.7 | 3B | 99.2 | 82.1 | 84.8 | 62.1 | 49.2 | 4.67 | 4.48 | 90.2/89.6 |
关键读数:
- RoboCasa 53.5 → 62.1(相对 Being-H0.5 +8.6pp)是最大的单项提升。
- RoboTwin 2.0 的鲁棒性最亮眼:clean 90.2% → 重度域随机化 89.6%,只掉 0.6pp。
- RoboCasa 上仍输给 Cosmos-Policy 的 67.1%(一个 2B 的显式 world model),RoboTwin 上输给 LingBot-VA 和 Fast-WAM —— 论文没有回避,但也没深入讨论。
4.2 真机:三平台、12 任务、五个能力维度¶
平台:PND Adam-U(19 body DoF + 双 Linkerbot O6 手)、Unitree G1(26-DoF 上身接口 + AMO 做 50Hz 全身平衡后端)、Franka FR3(7-DoF + 单手)。
评测协议做得很规范:统一 black-box inference server,随机化被测 endpoint 与 rollout 顺序,操作员盲测、二值判定,每任务 20 trials。

| 能力维度 | 代表任务 | 结果 |
|---|---|---|
| Dynamic Scene | 接快速滚动的球、球拍改向、往移动容器倒液体、传送带交互 | 优势最大;最强 baseline 是 Fast-WAM(与其低延迟定位一致) |
| Motion Reasoning | 轨迹预判、相对速度、接触时机 | 排序与 Dynamic Scene 基本一致 |
| Physical Reasoning | 移液管转移、漏斗倒液、叠衣、鞋楦插入、锤钉 | 最接近的 baseline 是 Being-H0.5 |
| Long Horizon | 装鞋盒等多阶段 | 同上 |
| Generalization | 布局/层高/容器/物体实例/相机几何变化 | 跨本体保持提升 |
Being-H0.7 五个 suite 全部领先。作者强调这个「提升遍布整个 benchmark 而非集中在某个角落」才是真机部分的主要结论。
4.3 推理成本¶

配合 UAC 后 Being-H 变体进入 3–4 ms/step,且显存与非 UAC 版本持平 —— 这是相对显式 world model 的核心卖点:拿到了预测性收益,没有付出 rollout 的代价。
5. 引申问题 / 讨论¶
5.1 做得好的地方¶
-
问题 framing 是这一系列里最漂亮的一次。"world model 的收益是否必须以生成像素为代价" 这个问题问得极准,而且答案(训练时注入未来、推理时丢弃)在方法论上是干净的 —— 它把 world model 从「一个要跑的模块」降级成「一种训练信号」。这个思路的普适性远超本文,可以套到任何有「训练时可获得特权信息」的场景。
-
prior/posterior 的结构对齐设计考虑得很细。两分支不是简单地跑两次前向:打包进同一条序列一次前向、用 dual-branch attention mask 隔离、给对应位置赋予相同 positional ID 保证结构匹配 —— 最后一条尤其容易被忽略,没有它两组 token 在 RoPE 下就不在同一个「相位」上,对齐损失会退化。
-
主动识别并修补了 trivial solution。隐状态 L2 对齐天然有坍缩解,作者不是等审稿人指出来,而是直接上了范数保持 + 谱熵正则。用负谱熵度量方向多样性比常见的余弦相似度惩罚更根本 —— 它约束的是整个 Gram 谱的平坦度,而不只是两两之间。
-
真机评测协议是本系列最严格的一次:黑盒 inference server 统一执行栈、随机化 endpoint 与顺序、操作员盲测。相比 Being-H0 那种「20 trials 报个数」进步巨大,而且这套协议本身就是对自家 Rethink-VLA 提出的 Grouped Blind Ensemble 的落实 —— 说明公司内部的方法论批评真的被产品线吸收了。
-
能力导向的 suite 划分(dynamic / physical / motion / long-horizon / generalization)比任务列表更有信息量,而且是 compositional 的(一个任务可带多个标签)。尤其 Dynamic Scene 这一组直接对应「为什么需要 future-aware」的假设 —— 结果也确实在这组上优势最大,假设与验证是闭环的。
-
老实承认 Fast-WAM 在反应型任务上是最强 baseline,并把原因归到它的低延迟定位上。没有把对手写成稻草人。
5.2 做得不够好 / 值得质疑的地方¶
-
最该做的消融没有做:\(\mathcal{L}_{\text{align}}\) 到底贡献了多少? 全文的核心主张是「未来信息通过对齐塑造了 latent 空间」,那么最关键的对照就是「有 latent query 但 \(w_{\text{align}}=0\)」—— 即只保留潜在推理空间、不注入任何未来信息。如果这个 baseline 也能拿到大部分收益,那论文的故事就要重写成「插入 latent query 增加了有效深度」而非「latent world model」。我在正文和实验章节里没有找到这个对照。同样缺失的还有 \(K\)(16)、\(L\)(9)、\(w_{\text{align}}\)(\(10^{-3}\))的 sensitivity。
-
「不生成未来帧」的效率优势被过度宣传了。3–4 ms/step 这个数字主要来自 UAC(继承自 Being-H0.5),而不是「不做 rollout」本身。图里也是 "UAC-enabled Being-H variants" 进入这个区间。真正该报的是「同架构 + 显式未来帧生成」vs「本方法」在同一部署栈下的延迟差 —— 没有这个对照,读者无法把效率收益归因给核心贡献。
-
posterior 分支的训练开销没有报告。虽然打包进一条序列,但序列长度实实在在多了 \(K=16\) 个 token 加一整套未来帧编码(\(256\times256\) 的 ViT 前向 + Perceiver)。训练时间/显存相对单分支增加多少?对一个把「训练效率」作为对比 world model 卖点的工作,这是必须交代的。
-
RoboCasa 上输给 Cosmos-Policy(62.1 vs 67.1)动摇了核心论点。Cosmos-Policy 是 2B 的显式 world model,比 H0.7 的 3B 还小,却在 RoboCasa 上高 5pp。这个反例直接挑战了「像素预测是昂贵且间接的底座」的论断 —— 至少在这个 benchmark 上,显式未来生成买到了本方法买不到的东西。论文把它列在表里但没有一句分析。RoboTwin 上输给 LingBot-VA / Fast-WAM 也是同理。
-
latent 可视化(
vis_v0.pdf)在正文里几乎没有解读。既然核心主张是「latent 编码了 future-aware、action-useful 结构」,那这张图本该是全文最重要的证据 —— 应该展示 latent 在接触前/接触时/接触后如何变化、能否解码回未来场景的粗略结构、在动态任务上是否真的在跟踪物体运动。现在只有一个图注「Visualization of the Latent Reasoning」,等于把最关键的机理证据浪费掉了。 -
换了 Action Expert backbone(Qwen3)和视觉编码器(V-JEPA2.1)两个变量。相对 Being-H0.5(Action Expert 未特别说明、视觉走 InternVL3.5 自带),H0.7 同时换了这两个组件。V-JEPA2.1 本身就是个强自监督视频表征模型,「用了 V-JEPA 特征」和「做了 prior-posterior 对齐」的贡献无法分离 —— 而这两件事恰好都是「让表征带上时序/预测结构」,高度可替代。
-
未来观测用 \(256\times256\) 而 context 用 \(224\times224\) 这个不对称没有解释。posterior 分支看到的是更高分辨率的未来 —— 这让对齐任务对 prior 分支更难(要从低分辨率当前帧匹配高分辨率未来的编码),也可能相反地引入了尺度不匹配。这个选择需要一句话说明。
-
对齐只作用在最后 9 层,但 §3.1 的论证是「latent query 随逐层传播渐进组织信息」。如果渐进组织是核心机制,为什么只对齐末端?前面若干层的 latent 是否已经偏离?这里的设计与叙事有轻微脱节。
-
仍然没有摆脱 LIBERO 饱和问题:99.2% vs Being-H0.5 的 98.9%、MINT 的 98.7% —— 在这个区间报小数点后一位已经没有意义,而 BeTTER(自家 2604.18000)恰恰论证了静态 benchmark 会掩盖表征退化。好在本文加入了 LIBERO-plus 和 RoboTwin-Hard 这类扰动 benchmark,部分对冲了这个问题。
5.3 值得继续探讨的方向¶
- 把 posterior 换成更强的特权信息:现在 posterior 只看未来 RGB。如果换成未来的接触力/触觉序列(对接 TTP 2607.01067)、或未来的物体 6D 位姿、或人类演示的完整轨迹,latent 会被塑造成什么样?这是 privileged-information distillation 在具身领域最自然的展开。
- latent 空间的可解释性研究:训一个 decoder 把 latent 解回粗粒度未来场景,验证它到底编码了什么。这既是机理证据,也可能变成一个免费的「模型在想什么」的可视化工具。
- prior-posterior 的差距能否当作不确定性信号?\(\|h^{\text{prior}}-h^{\text{post}}\|\) 在训练时可算,推理时算不了 —— 但可以训一个小 head 去预测这个差距,作为 out-of-distribution 检测或 ask-for-help 触发器(跟 MPG 的 gate 是同一类思路,可以合并)。
- 对齐层数与深度的关系:把对齐从最后 9 层推广到全层、或做成层数递增的 curriculum,验证 §3.1 的「渐进组织」叙事。
- 与显式 world model 的融合而非对立:既然 Cosmos-Policy 在 RoboCasa 上更强,一个自然的问题是能否训练时同时做像素预测和 latent 对齐、推理时只留 latent —— 这其实就是 Fast-WAM 与 H0.7 的合体。
- 动态任务的时间尺度上限:接滚动球已经很难,但 chunk \(T=20\)、观测 horizon \(H=4\) 意味着模型的「预见窗口」有限。在需要秒级预判的任务(抛接、动态避障)上这个窗口够不够?
参考资源¶
- 论文 PDF: paper.pdf
- LaTeX 源码: source/
- 系列总览: BeingBeyond 系列 paper reading
- 前作: Being-H0.5 (2601.12993)|Being-H0 (2507.15597)
- 关键 baseline / 相关论文: Fast-WAM (2603.16666), LingBot-VA (2601.21998), Cosmos-Policy, DreamVLA (2507.04447), π₀.₅ (2504.16054), JALA (2602.21736), V-JEPA 2, Qwen3, InternVL3.5