Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos¶
论文阅读笔记 — 用于后续讨论的概览
BeingBeyond(智在无界)Being-H 系列的奠基之作。系列脉络见 BeingBeyond 系列总览。
1. 基础信息¶
- 题目: Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
- 作者: Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu — BeingBeyond(智在无界)+ 北京大学 + 中国人民大学
- arXiv 编号: 2507.15597(submitted 2025-07,37 页,ICML 2026)
- 项目主页: https://beingbeyond.github.io/Being-H0
- 代码 / 权重: https://github.com/BeingBeyond/Being-H0(1B / 8B / 14B + GRVQ tokenizer 全部开源)
- 关键词: physical instruction tuning, hand motion tokenization, MANO, grouped residual quantization, egocentric human video, dexterous VLA, UniHand
Figure 1:Being-H0 的核心主张 —— 把「人手」当作 foundation manipulator。左侧是从 mocap / VR / RGB-only 三类异构人类视频中抽取的 MANO 手部动作,中间是把动作当成「外语」灌进 LMM 词表做 next-token prediction 的预训练,右侧是 post-training 后迁移到真实灵巧手。这张图定义了整个 Being-H 系列此后三代的技术路线。
2. 文章介绍¶
2.1 解决的领域和问题¶
主线是 dexterous VLA 的数据瓶颈。当时(2025 年中)主流 VLA(RT-2、OpenVLA、π₀)全部依赖 teleoperation 采集的真机数据,而这类数据比 LLM 的互联网语料小好几个数量级 —— 作者称之为 embodied intelligence 的 "data swamp"(数据沼泽)。
这个稀缺性对灵巧手尤其致命:遥操作一只多指手的硬件成本和操作复杂度远高于夹爪,导致绝大多数 VLA 被迫退化到 simple gripper,而夹爪的自由度根本承载不了精细手指协调与力度调制。走仿真合成数据这条路(UniDexGrasp 系列)则卡在 diversity 不足 + sim-to-real gap 上。
2.2 Motivation¶
论文开篇把问题提炼成一个非常干净的问句:
Can we pretrain a dexterous VLA from large-scale human videos, analogous to GPT-3, to explicitly imitate human actions and adapt to robot hands via post-training?
作者的核心论断是一个关于「同构性」的诊断,这是全文最有价值的洞察:
- 在 LLM / LMM 里,pretraining 数据和 downstream 数据是 isomorphic(同构) 的 —— 文本推理天然对齐语言任务,图文理解天然迁移到多模态任务,所以 visual instruction tuning 能吃到巨大红利。
- 在 VLA 里,这个对齐变成了 heterogeneous(异构) —— 文本/2D 视觉输入 与 3D 动作空间 + proprioception 之间存在结构性鸿沟。
这就解释了为什么此前一堆「从人类视频学机器人」的 implicit 方法(R3M 的 contrastive、MVP 的 MAE、GR00T 的 latent action)都没能复刻 LLM 那种量级的跃迁:它们学的是表征,没有把「动作」这个模态本身显式建模进预训练目标。Being-H0 的赌注是 —— 把人手动作显式 tokenize 成一门「外语」,让 pretraining 和 post-training 重新变成同构问题。
2.3 之前工作的问题¶
| 类别 | 代表工作 | 缺陷 |
|---|---|---|
| 遥操作真机 VLA | RT-2, OpenVLA, π₀ | 数据量比互联网语料小几个数量级;灵巧手采集成本极高,被迫退化到夹爪 |
| 仿真合成灵巧数据 | UniDexGrasp / UniDexGrasp++ / DexGraspVLA | diversity 有限、sim-to-real gap 未解决,真机部署困难 |
| 人类视频 隐式 表征学习 | R3M (contrastive), MVP (MAE), GR00T N1 (latent action) | 学到的是视觉表征,动作模态未被显式建模;迁移机理不清楚,收益远不及 LLM 的 instruction tuning |
| 人类视频 显式 表征 | Humanoid-centric 方法 | 方向对,但训练规模太小,违背了「用 web-scale 数据」的初衷 |
2.4 论文解决方案(一句话)¶
把人手 MANO 动作用 part-level GRQ 量化成毫米级精度的离散 token、扩进 LMM 词表当作第四种「语言」,在 1155 小时 / 1.65 亿条指令样本的 UniHand 上做统一 next-token prediction 预训练(physical instruction tuning),再用轻量 action query + MLP 头 post-train 迁移到真实灵巧手。
2.5 与前序工作的关系¶
- Backbone 直接复用 InternVL3(1B / 8B / 14B 三档),视觉编码器是 InternViT-300M + 2 层 MLP projector,沿用其 dynamic high-resolution tiling。
- 动作 tokenizer 借鉴 HiFi-Codec 的 GRQ-VAE 和 RQ-VAE 的 residual quantization。
- "motion as a foreign language" 的思路直接来自作者自己的 Being-M0(2410.03311,见 §5.3)—— 这是 Being-M(人体动作生成)线向 Being-H(机器人操作)线的技术输血。
- 主要对照 baseline 是 NVIDIA GR00T N1.5,因为它是当时唯一在 egocentric 人类视频上大规模预训练、且面向灵巧手的 VLA。
3. 方法介绍¶
Figure 2:Physical Instruction Tuning 的三段式参数演化。左:part-level tokenization + physical space alignment 把异构数据源统一。中:预训练把 \(\Theta_{v,t}\) 扩展到 \(\Theta_{v,t,m}\),vision/text/motion 三模态在同一条序列里共享 attention。右:post-training 再接入 action 参数得到 \(\Theta_{a,v,t|m}\)。注意 motion 在最后一阶段是作为「已内化的先验」(竖线右侧)而非直接输出。
3.1 形式化¶
模型处理三种模态并统一成离散 token 序列 \(\mathbf{S}=\{s_i\}\),走标准 next-token prediction。手部动作用 MANO 参数化:
其中 \(\theta\) 是 15 个手指关节旋转、\(\mathbf{r}_{rot}\) 是全局腕部旋转、\(\tau\) 是腕部平移、\(\beta\) 是手型 shape 参数。
motion tokenizer 把 \(T\) 帧特征 \(\mathcal{M}\in\mathbb{R}^{T\times D}\) 编码成 \(\lceil T/\alpha\rceil\) 个 token(\(\alpha=4\) 为时间下采样率)。
3.2 Motion Feature 的选择(一个很实在的消融)¶
作者系统对比了 5 种 MANO 特征编码:
| 特征 | 维度 | 构成 |
|---|---|---|
| MANO-D51 | 51 | axis-angle 的 \(\theta\)(45) + \(\mathbf{r}_{rot}\)(3) + \(\tau\)(3) |
| MANO-D99 | 99 | 6D rotation 的 \(\theta\)(90) + \(\mathbf{r}_{rot}\)(6) + \(\tau\)(3) |
| MANO-D109 | 109 | D99 + shape \(\beta\)(10) |
| MANO-D114 | 114 | D51 + 关节位置 \(j\)(63) |
| MANO-D162 | 162 | D99 + 关节位置 \(j\)(63) ← 最终选用 |
结论有一个漂亮的结构性解释:
- 6D rotation 对手指更好(连续、数值稳定,适合精细旋转),
- axis-angle 对腕部更好(紧凑、高效,适合大幅但简单的旋转)。
有意思的是重建误差最低的特征不是训练效果最好的特征 —— axis-angle 整体 MPJPE 更低(因为腕部误差占主导),但作者最终选了 6D 的 MANO-D162,因为它在 Being-H0 的实际生成任务上更强。作者的解释是「腕部模式对 LMM 相对易学,手指精细动作才是瓶颈」。此外,加入关节位置 \(j\) 作为辅助监督有帮助,而建模 shape 参数 \(\beta\) 反而掉点 —— 所以 \(\beta\) 被固定为序列首帧值,让 tokenizer 专注动力学。
3.3 Part-Level Grouped Residual Quantization¶
Figure 3:part-level GRQ tokenizer。特征沿 channel 分成 \(n\) 组,每组走 \(L\) 层 residual VQ,腕部和手指各用一套独立 tokenizer。
对每组 \(z^{(g)}\) 做 \(L\) 层残差量化:
总损失(含专门为腕部加的重建项):
关键设计 —— part-level 拆分:腕部 \(\{\mathbf{r}_{rot},\tau\}\) 和手指 \(\{\theta,\beta\}\) 各自用一套独立 tokenizer。动机是腕部参数分布跨越整个 3D 空间、重建难度远高于手指,混在一起量化会让 codebook 被腕部主导。拆开后既提升了建模精度,也给了 LMM 显式的 token 语义(这串 token 是腕部、那串是手指),便于学结构化的手部动力学。拆分后 \(\mathcal{L}_{\text{wrist}}\) 就不需要了。
3.4 Physical Space Alignment(统一异构相机)¶
这是 Being-H0 区别于普通 "motion as language" 工作的关键一步,用来解决 11 个数据源相机内参各异的问题。
(1) Weak-Perspective Projection Alignment. 把所有数据投到统一的弱透视相机空间:
保证「相同深度的物体有一致的像素尺度」。鱼眼等强畸变先归一化 FoV 到 90°。
(2) View-Invariant Motion Distribution Balancing. 传统图像增广(随机裁剪、翻转)会破坏 2D 图像与 3D 手部动作之间的弱透视一致性,所以作者设计了两个几何自洽的增广:
- Depth Scaling:把手的深度缩放 \(\tau_c^{z'}=\lambda_s\cdot\tau_c^z\),同时把配对图像按 \(1/\lambda_s\) 反向缩放,保持弱透视一致。
- In-Plane Rotation:绕相机光轴旋转 \(\varphi\),同步更新腕部位置和旋转 \(\tau_c'=R_z(\varphi)\tau_c\)、\(R_c'=R_z(\varphi)R_c\),图像同步旋转。
目的是防止大数据源(EgoDex 占绝对多数)的相机配置主导整个分布,压制小数据源。
3.5 训练目标:两级 masking¶
标准 next-token prediction 之上加了两个针对性设计:
- Vocabulary-Level Logit Masking:motion code 只占词表极小一部分,以概率 \(\mathcal{P}=50\%\) 把非 motion logits 置 \(-\infty\),避免梯度被大量无关 token 稀释。
- Token-Level Loss Masking:手部动作复杂度差异巨大(从静止姿态到不可预测的抖动),按 loss 分位数 \([15\%, 95\%]\) 过滤极端值,专注于「中等难度」token。
3.6 三种解码模式¶
| 模式 | 约束 | 用途 |
|---|---|---|
| Free-format | 无约束自由采样 | 测「模型是否自发学会 motion block 格式」 |
| Block-formatted | <MOT>/</MOT> 之间只允许采样 motion 词表 |
公平对比不同规模模型 |
| Soft-formatted | 每块生成后与 GT 取均值再重量化 | 长序列评测,抑制误差累积 |
3.7 Post-Training:迁移到真实灵巧手¶
人手和机器手的运动学差异导致 motion token 不能直接迁移。作者用了一个刻意简单的方案(明确把 discrete action token / diffusion policy 留给 future work):
- 用 VLA backbone 当预训练 encoder;
- 轻量 MLP \(f_p\) 把 proprioception 投到 embedding 空间;
- \(N_a\) 个可学习 query token \(\{\mathbf{q}_i\}\) 去 attend 上下文;
- 回归头 \(f_r\) 输出可执行位姿,L1 损失:
Figure 4:post-training 阶段的架构。预训练得到的 motion 先验不再直接输出,而是作为 backbone 内部表征去支撑 action query 的回归。
3.8 UniHand 数据集¶
| 来源类型 | 代表数据集 | 特点 |
|---|---|---|
| Motion capture | ARCTIC, FPHA, H2O, HOI4D, HOT3D, OAKINK2, TACO, DexYCB | 多视角 mocap,3D 标注精度高,但场景 diversity 有限 |
| VR-recorded | EgoDex(829 小时,占绝对主导), HoloAssist | Apple Vision Pro 等设备 + SLAM 追踪,自然交互 + 可靠 3D GT |
| Pseudo-annotated | Taste-Rob | HaMeR 伪标注,噪声大但 scalable、diversity 高 |
总计:11 个数据源、444.1K 条轨迹、1.3 亿帧、1155 小时、1.665 亿条指令样本。 实际预训练因算力限制采样了均衡子集 UniHand-2.5M。
被主动排除的数据(值得注意):Ego4D(手频繁遮挡/出画)、EPIC-Kitchens(动态视角)。
标注流水线用 Gemini-2.5-Flash-Lite 做两级标注(chunk 级 ≤10 秒的祈使句指令 + per-second 级 1 秒重叠窗口的接触状态/物体属性/轨迹描述),再用 Gemini-2.5-Pro 从每类约 20 个模板扩展出多样化指令变体。三类任务:instructional motion generation / motion translation / contextual motion prediction。
3.9 Implementation Details¶
- tokenizer:8 层 GRQ、group size \(n=2\)、codebook \(K_w=K_f=4096\)、code dim \(d=512\)、\(\alpha=4\) → 每手每秒 128 个 motion token;batch 2048、lr \(2\times10^{-4}\)、\(\lambda_1=0.02\)、\(\lambda_2=1.0\),EMA 更新 codebook。
- 主模型:InternVL3 1B/8B/14B,图像 \(448\times448\),MANO-D162 @ 15 FPS,AdamW lr \(1\times10^{-5}\)、batch 128、32 × A800-80G,ViT adapter 与 LLM backbone 联合微调。
- 真机:7-DoF Franka Research 3 + 6-DoF Inspire 手 + RealSense L515;遥操作用 Gello 外骨骼控制手臂 + D435i 做手部姿态估计与重定向;每任务 50–100 条轨迹。
4. 结果对比¶
4.1 手部动作生成格式有效率(free-format 模式)¶
| 模型 | Valid Generation Rate |
|---|---|
| Being-H0-1B | 仅中等 |
| Being-H0-8B | 99.8% |
| Being-H0-14B | 100% |
说明结构化格式的掌握本身就是一种 scaling 收益 —— 小模型学不会稳定输出合法 motion block。
4.2 真机灵巧操作成功率(每任务 20 次随机化试验)¶
| Task | GR00T N1.5 | InternVL3(无预训练) | Being-H0 |
|---|---|---|---|
| Pick-Place-Toy (Seen) | 0.75 | 0.55 | 0.75 |
| Pick-Place-Toy (Unseen) | 0.40 | 0.55 | 0.65 |
| Pick-Place-Toy (Clutter) | 0.50 | 0.50 | 0.60 |
| Close-Toolbox | 0.80 | 0.50 | 0.85 |
| Close-Lid | 0.50 | 0.25 | 0.60 |
| Pour-Cup | 0.90 | 0.55 | 1.00 |
| Unfold-Clothes | 0.60 | 0.45 | 0.75 |
关键对照是 InternVL3:同架构同规模,唯一差别是没有手部动作预训练与 physical alignment。Being-H0 在 7 项里全面领先,其中 Close-Lid(0.60 vs 0.25)和 Pour-Cup(1.00 vs 0.55)差距最大 —— 都是要求精细位姿与轨迹平滑度的任务,恰好对应人手动作先验最该起作用的地方。
4.3 数据效率¶
Figure 5:不同 teleoperation 数据量下的成功率。Being-H0(预训练)vs InternVL3(无预训练)。
Pick-Place-Toy:Being-H0 用 25% 数据 ≈ baseline 用 100% 数据。Close-Toolbox/Unfold-Clothes:25% ≈ baseline 的 50%。Close-Lid:baseline 在 25% 数据下完全失败(0%),Being-H0 已有 15%。
这是全文最有说服力的一组数字 —— 它把「人类视频预训练」的价值直接换算成了真机数据采集成本的下降。
4.4 关键消融¶
Figure 6:模型规模与数据规模的 scaling 曲线。
| 消融维度 | 结论 |
|---|---|
| Part-level vs 4-group vs 16-layer RQ | part-level 在同等 token 数与 codebook 容量下重建最好 |
| MANO 特征 | 重建最优 ≠ 生成最优;最终选 6D 的 D162;加关节位置 \(j\) 有益,建模 \(\beta\) 有害 |
| 模型规模 1B→8B→14B | MPJPE / MWTE / PA-MPJPE / M2T R@3 / FID 全线单调改善,tail split 上提升尤其明显 |
| View-balance 增广 | 提升未见相机配置下的泛化 |
5. 引申问题 / 讨论¶
5.1 做得好的地方¶
-
「同构性」诊断是全文的灵魂。把「为什么 VLA 没有复刻 LLM 的 instruction tuning 红利」归因到 pretraining/downstream 数据结构的异构性,这个 framing 比单纯说「数据不够」深刻得多,也直接推导出了「显式建模动作模态」的解法。整个 Being-H 系列后面三代都是在这条推论上做加法。
-
Part-level tokenization 的动机是数据驱动的,不是拍脑袋。作者先观察到「腕部参数分布跨越整个 3D 空间、重建误差主导整体」,再拆出独立 tokenizer,还顺手发现拆完之后专门的 \(\mathcal{L}_{\text{wrist}}\) 就不需要了 —— 这种「设计消除了自己引入的补丁」是好设计的标志。
-
敢于报告「重建最优 ≠ 生成最优」这个反直觉结果,并给出了结构性解释(腕部易学、手指是瓶颈)。很多论文会直接选重建指标最好的配置然后不提这件事。
-
Physical space alignment 里的几何自洽增广。意识到「随机裁剪/翻转会破坏弱透视一致性」,转而设计 depth scaling(图像反向缩放补偿)和 in-plane rotation(同步旋转位姿与图像),这是真正理解了 2D-3D 耦合关系才写得出来的增广。
-
InternVL3 作为对照 baseline 选得极好。同架构、同规模、同 post-training 数据,唯一变量是有无手部预训练 —— 这是能干净归因的对照,比跟 GR00T 比更有说服力。
-
数据效率实验把学术收益翻译成了工程收益。25% 数据打平 100% 这个数字,对任何要做真机数据采集预算的团队都是直接可用的。
5.2 做得不够好 / 值得质疑的地方¶
-
真机评测规模太小,统计上撑不住结论。每任务 20 trials、7 个任务。0.75 vs 0.55 在 n=20 下的 95% 置信区间是严重重叠的(约 ±0.19),单看任何一项都不显著。论文没做任何显著性检验,"全面领先" 更多是靠 7 项一致的方向性而非单项的强度。
-
UniHand 的「1155 小时 / 1.665 亿样本」有很大水分。(a) EgoDex 一家就贡献 829.4 小时(占 72%)和 7060 万条指令(占 42%),所谓「11 个数据源的多样性」实际高度集中;(b) 1.665 亿「指令样本」是模板 × Gemini 扩写 × view-balance 增广乘出来的,不是 1.665 亿个独立交互 —— 真实轨迹只有 444K 条;(c) 实际预训练只用了 UniHand-2.5M,即全量的 1.5%。所以标题里的 "Large-Scale" 与真正进入训练的数据量之间差了近两个数量级。
-
Post-training 方案被作者自己承认是权宜之计,用 MLP 回归头 + L1 loss,明确把 discrete action token 和 diffusion policy 列为 future work。这意味着「预训练的收益」和「post-training 方案的弱」被混在了一起 —— 有可能 Being-H0 的真机数字被一个偏弱的 action head 拖了后腿,也有可能 InternVL3 baseline 同样受害因而对照仍然公平。但读者无法判断,因为没有「同一预训练 + 更强 action head」的对照。(这一点在 Being-H0.5 换成 flow matching 后被间接修正了。)
-
动作 token 的信息率高得可疑:每手每秒 128 个 token,双手就是 256 token/秒。一个 10 秒序列光动作就 2560 token。这直接导致长序列生成必须靠 soft-formatted 模式(混入 ground-truth 再重量化)才能维持精度 —— 而 soft-formatted 本质上是在推理时偷看答案,用它报告的长序列指标不能代表真实自回归能力。论文对这一点的表述比较含糊。
-
「人手是 foundation manipulator」这个主张只在 Inspire 六自由度灵巧手上验证过。MANO 有 15 个手指关节,Inspire 手只有 6 DoF —— 从 45 维手指旋转到 6 维的重定向是一个信息量剧烈压缩的过程。人手动作先验里究竟有多少在这个瓶颈后还幸存,论文没有分析。对夹爪的适配则完全是一句「wrist motion 可以当 end-effector 先验,前人做过,故不展开」带过。
-
主动排除 Ego4D 和 EPIC-Kitchens 削弱了 "web-scale" 的叙事。这两个恰恰是最大、最 in-the-wild 的第一人称数据集。排除理由(遮挡、动态视角)是合理的工程判断,但也意味着 Being-H0 的 pipeline 依赖「手部大部分时间清晰可见 + 相机相对稳定」,离真正的「互联网视频」还有距离。(这个缺口正是 JALA 2602.21736 后来要补的。)
-
GR00T N1.5 这个对照的公平性存疑。GR00T 的 latent action 是为它自己的训练配方设计的,被搬到 Franka + Inspire 这套 Being-H0 自建硬件上、用 50–100 条轨迹 post-train,很可能没跑在它的最优点上。论文也确实没说 GR00T 的 post-training 超参是否单独调过。
-
两级 masking 的超参(\(\mathcal{P}=50\%\)、分位数 \([15\%,95\%]\))没有消融。这两个是相当激进的干预(一半的 step 直接屏蔽掉整个非动作词表),却没有 sensitivity 分析,也没解释为什么是 50% 而不是 30% 或 80%。
-
多模态 attention 的「统一」可能被高估。论文强调 vision/text/motion 共享 \(W_Q,W_K,W_V\) 投影,但 motion token 只是词表扩展出来的新 embedding,和视觉 token 走的完全是同一套参数 —— 这跟 π₀ 那种独立 action expert 是两条路线。哪条更好,论文没有对照(Being-H0.5 后来倒戈到了 MoT 双专家路线,某种程度上是对这一设计的自我修正)。
5.3 值得继续探讨的方向¶
- 腕部用 axis-angle、手指用 6D rotation 的混合表征 —— 作者自己在 §3.2 明确列为 future work,而且从他们给出的分析看,这几乎是必然能拿到收益的低垂果实。为什么没在这篇里做完?
- 把 soft-formatted 换成真正的 closed-loop 长序列生成,或者引入 chunk 级 re-anchoring 机制,才能诚实地评估长程能力。
- 降低 motion token 的信息率:128 token/手/秒 是否必要?能否用类似 FAST 的 DCT+BPE 思路把动作压到 10× 更短?这直接决定了能否把动作 context 拉长到分钟级。
- 验证「人手先验」在极端形态差异下的存活率:从 MANO 45 维手指到 6 DoF、到 2 指夹爪、到吸盘,先验收益应该有一条衰减曲线,把它画出来会比「我们在灵巧手上有效」有力得多。
- Ego4D / EPIC-Kitchens 这类 in-the-wild 数据怎么进来 —— 需要能容忍噪声手部标注的训练目标(这正是 JALA 走的路)。
- motion token 与 action 之间的关系:post-training 阶段 motion 只是作为 backbone 内部先验,没有显式输出。如果让模型同时输出人手 motion 和机器人 action(多任务),会不会让先验保持得更好、抵抗 catastrophic forgetting?
参考资源¶
- 论文 PDF: paper.pdf
- LaTeX 源码: source/
- 系列总览: BeingBeyond 系列 paper reading
- 后续工作: Being-H0.5 (2601.12993)、Being-H0.7 (2605.00078)
- 关键 baseline / 相关论文: GR00T N1.5 (NVIDIA), InternVL3 (2504.10479), π₀ (2410.24164), OpenVLA (2406.09246), R3M (2203.12601), HiFi-Codec GRQ-VAE (2305.02765), MANO (2201.02610), HaMeR (2312.05251), EgoDex (2505.11709)