跳转至

Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos

论文阅读笔记 — 用于后续讨论的概览

BeingBeyond(智在无界)Being-H 系列的奠基之作。系列脉络见 BeingBeyond 系列总览


1. 基础信息

  • 题目: Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
  • 作者: Hao Luo, Yicheng Feng, Wanpeng Zhang, Sipeng Zheng, Ye Wang, Haoqi Yuan, Jiazheng Liu, Chaoyi Xu, Qin Jin, Zongqing Lu — BeingBeyond(智在无界)+ 北京大学 + 中国人民大学
  • arXiv 编号: 2507.15597(submitted 2025-07,37 页,ICML 2026
  • 项目主页: https://beingbeyond.github.io/Being-H0
  • 代码 / 权重: https://github.com/BeingBeyond/Being-H0(1B / 8B / 14B + GRVQ tokenizer 全部开源)
  • 关键词: physical instruction tuning, hand motion tokenization, MANO, grouped residual quantization, egocentric human video, dexterous VLA, UniHand

teaser Figure 1:Being-H0 的核心主张 —— 把「人手」当作 foundation manipulator。左侧是从 mocap / VR / RGB-only 三类异构人类视频中抽取的 MANO 手部动作,中间是把动作当成「外语」灌进 LMM 词表做 next-token prediction 的预训练,右侧是 post-training 后迁移到真实灵巧手。这张图定义了整个 Being-H 系列此后三代的技术路线。

2. 文章介绍

2.1 解决的领域和问题

主线是 dexterous VLA 的数据瓶颈。当时(2025 年中)主流 VLA(RT-2、OpenVLA、π₀)全部依赖 teleoperation 采集的真机数据,而这类数据比 LLM 的互联网语料小好几个数量级 —— 作者称之为 embodied intelligence 的 "data swamp"(数据沼泽)。

这个稀缺性对灵巧手尤其致命:遥操作一只多指手的硬件成本和操作复杂度远高于夹爪,导致绝大多数 VLA 被迫退化到 simple gripper,而夹爪的自由度根本承载不了精细手指协调与力度调制。走仿真合成数据这条路(UniDexGrasp 系列)则卡在 diversity 不足 + sim-to-real gap 上。

2.2 Motivation

论文开篇把问题提炼成一个非常干净的问句:

Can we pretrain a dexterous VLA from large-scale human videos, analogous to GPT-3, to explicitly imitate human actions and adapt to robot hands via post-training?

作者的核心论断是一个关于「同构性」的诊断,这是全文最有价值的洞察:

  • 在 LLM / LMM 里,pretraining 数据和 downstream 数据是 isomorphic(同构) 的 —— 文本推理天然对齐语言任务,图文理解天然迁移到多模态任务,所以 visual instruction tuning 能吃到巨大红利。
  • 在 VLA 里,这个对齐变成了 heterogeneous(异构) —— 文本/2D 视觉输入 与 3D 动作空间 + proprioception 之间存在结构性鸿沟。

这就解释了为什么此前一堆「从人类视频学机器人」的 implicit 方法(R3M 的 contrastive、MVP 的 MAE、GR00T 的 latent action)都没能复刻 LLM 那种量级的跃迁:它们学的是表征,没有把「动作」这个模态本身显式建模进预训练目标。Being-H0 的赌注是 —— 把人手动作显式 tokenize 成一门「外语」,让 pretraining 和 post-training 重新变成同构问题

2.3 之前工作的问题

类别 代表工作 缺陷
遥操作真机 VLA RT-2, OpenVLA, π₀ 数据量比互联网语料小几个数量级;灵巧手采集成本极高,被迫退化到夹爪
仿真合成灵巧数据 UniDexGrasp / UniDexGrasp++ / DexGraspVLA diversity 有限、sim-to-real gap 未解决,真机部署困难
人类视频 隐式 表征学习 R3M (contrastive), MVP (MAE), GR00T N1 (latent action) 学到的是视觉表征,动作模态未被显式建模;迁移机理不清楚,收益远不及 LLM 的 instruction tuning
人类视频 显式 表征 Humanoid-centric 方法 方向对,但训练规模太小,违背了「用 web-scale 数据」的初衷

2.4 论文解决方案(一句话)

把人手 MANO 动作用 part-level GRQ 量化成毫米级精度的离散 token、扩进 LMM 词表当作第四种「语言」,在 1155 小时 / 1.65 亿条指令样本的 UniHand 上做统一 next-token prediction 预训练(physical instruction tuning),再用轻量 action query + MLP 头 post-train 迁移到真实灵巧手。

2.5 与前序工作的关系

  • Backbone 直接复用 InternVL3(1B / 8B / 14B 三档),视觉编码器是 InternViT-300M + 2 层 MLP projector,沿用其 dynamic high-resolution tiling。
  • 动作 tokenizer 借鉴 HiFi-Codec 的 GRQ-VAE 和 RQ-VAE 的 residual quantization。
  • "motion as a foreign language" 的思路直接来自作者自己的 Being-M0(2410.03311,见 §5.3)—— 这是 Being-M(人体动作生成)线向 Being-H(机器人操作)线的技术输血。
  • 主要对照 baseline 是 NVIDIA GR00T N1.5,因为它是当时唯一在 egocentric 人类视频上大规模预训练、且面向灵巧手的 VLA。

3. 方法介绍

physical instruction tuning Figure 2:Physical Instruction Tuning 的三段式参数演化。左:part-level tokenization + physical space alignment 把异构数据源统一。中:预训练把 \(\Theta_{v,t}\) 扩展到 \(\Theta_{v,t,m}\),vision/text/motion 三模态在同一条序列里共享 attention。右:post-training 再接入 action 参数得到 \(\Theta_{a,v,t|m}\)。注意 motion 在最后一阶段是作为「已内化的先验」(竖线右侧)而非直接输出。

3.1 形式化

模型处理三种模态并统一成离散 token 序列 \(\mathbf{S}=\{s_i\}\),走标准 next-token prediction。手部动作用 MANO 参数化:

\[m = \{\theta,\ \mathbf{r}_{rot},\ \tau,\ \beta\}\]

其中 \(\theta\) 是 15 个手指关节旋转、\(\mathbf{r}_{rot}\) 是全局腕部旋转、\(\tau\) 是腕部平移、\(\beta\) 是手型 shape 参数。

motion tokenizer 把 \(T\) 帧特征 \(\mathcal{M}\in\mathbb{R}^{T\times D}\) 编码成 \(\lceil T/\alpha\rceil\) 个 token(\(\alpha=4\) 为时间下采样率)。

3.2 Motion Feature 的选择(一个很实在的消融)

作者系统对比了 5 种 MANO 特征编码:

特征 维度 构成
MANO-D51 51 axis-angle 的 \(\theta\)(45) + \(\mathbf{r}_{rot}\)(3) + \(\tau\)(3)
MANO-D99 99 6D rotation 的 \(\theta\)(90) + \(\mathbf{r}_{rot}\)(6) + \(\tau\)(3)
MANO-D109 109 D99 + shape \(\beta\)(10)
MANO-D114 114 D51 + 关节位置 \(j\)(63)
MANO-D162 162 D99 + 关节位置 \(j\)(63) ← 最终选用

结论有一个漂亮的结构性解释

  • 6D rotation 对手指更好(连续、数值稳定,适合精细旋转),
  • axis-angle 对腕部更好(紧凑、高效,适合大幅但简单的旋转)。

有意思的是重建误差最低的特征不是训练效果最好的特征 —— axis-angle 整体 MPJPE 更低(因为腕部误差占主导),但作者最终选了 6D 的 MANO-D162,因为它在 Being-H0 的实际生成任务上更强。作者的解释是「腕部模式对 LMM 相对易学,手指精细动作才是瓶颈」。此外,加入关节位置 \(j\) 作为辅助监督有帮助,而建模 shape 参数 \(\beta\) 反而掉点 —— 所以 \(\beta\) 被固定为序列首帧值,让 tokenizer 专注动力学。

3.3 Part-Level Grouped Residual Quantization

motion tokenizer Figure 3:part-level GRQ tokenizer。特征沿 channel 分成 \(n\) 组,每组走 \(L\) 层 residual VQ,腕部和手指各用一套独立 tokenizer。

对每组 \(z^{(g)}\)\(L\) 层残差量化:

\[r_0 = z^{(g)}_i,\quad q_l = \arg\min_{c\in\mathcal{C}^{(g)}}\|r_{l-1}-c\|_2,\quad r_l = r_{l-1}-q_l,\quad \hat z^{(g)}_i=\sum_{l=1}^{L}q_l\]

总损失(含专门为腕部加的重建项):

\[\mathcal{L}=\mathcal{L}_{\text{recon}}+\lambda_1\mathcal{L}_{\text{commit}}+\lambda_2\mathcal{L}_{\text{wrist}},\quad \mathcal{L}_{\text{wrist}}=\|\mathbf{w}-\hat{\mathbf{w}}\|_2^2,\ \mathbf{w}=[\mathbf{r}_{rot},\tau]\]

关键设计 —— part-level 拆分:腕部 \(\{\mathbf{r}_{rot},\tau\}\) 和手指 \(\{\theta,\beta\}\) 各自用一套独立 tokenizer。动机是腕部参数分布跨越整个 3D 空间、重建难度远高于手指,混在一起量化会让 codebook 被腕部主导。拆开后既提升了建模精度,也给了 LMM 显式的 token 语义(这串 token 是腕部、那串是手指),便于学结构化的手部动力学。拆分后 \(\mathcal{L}_{\text{wrist}}\) 就不需要了。

3.4 Physical Space Alignment(统一异构相机)

这是 Being-H0 区别于普通 "motion as language" 工作的关键一步,用来解决 11 个数据源相机内参各异的问题。

(1) Weak-Perspective Projection Alignment. 把所有数据投到统一的弱透视相机空间:

\[s_x=\frac{f_x'}{f_x},\quad s_y=\frac{f_y'}{f_y},\quad \Delta x = c_x'-s_x c_x,\quad \Delta y=c_y'-s_y c_y\]

保证「相同深度的物体有一致的像素尺度」。鱼眼等强畸变先归一化 FoV 到 90°。

(2) View-Invariant Motion Distribution Balancing. 传统图像增广(随机裁剪、翻转)会破坏 2D 图像与 3D 手部动作之间的弱透视一致性,所以作者设计了两个几何自洽的增广:

  • Depth Scaling:把手的深度缩放 \(\tau_c^{z'}=\lambda_s\cdot\tau_c^z\),同时把配对图像按 \(1/\lambda_s\) 反向缩放,保持弱透视一致。
  • In-Plane Rotation:绕相机光轴旋转 \(\varphi\),同步更新腕部位置和旋转 \(\tau_c'=R_z(\varphi)\tau_c\)\(R_c'=R_z(\varphi)R_c\),图像同步旋转。

目的是防止大数据源(EgoDex 占绝对多数)的相机配置主导整个分布,压制小数据源。

3.5 训练目标:两级 masking

标准 next-token prediction 之上加了两个针对性设计:

  • Vocabulary-Level Logit Masking:motion code 只占词表极小一部分,以概率 \(\mathcal{P}=50\%\) 把非 motion logits 置 \(-\infty\),避免梯度被大量无关 token 稀释。
  • Token-Level Loss Masking:手部动作复杂度差异巨大(从静止姿态到不可预测的抖动),按 loss 分位数 \([15\%, 95\%]\) 过滤极端值,专注于「中等难度」token。

3.6 三种解码模式

模式 约束 用途
Free-format 无约束自由采样 测「模型是否自发学会 motion block 格式」
Block-formatted <MOT>/</MOT> 之间只允许采样 motion 词表 公平对比不同规模模型
Soft-formatted 每块生成后与 GT 取均值再重量化 长序列评测,抑制误差累积

3.7 Post-Training:迁移到真实灵巧手

人手和机器手的运动学差异导致 motion token 不能直接迁移。作者用了一个刻意简单的方案(明确把 discrete action token / diffusion policy 留给 future work):

  • 用 VLA backbone 当预训练 encoder;
  • 轻量 MLP \(f_p\) 把 proprioception 投到 embedding 空间;
  • \(N_a\) 个可学习 query token \(\{\mathbf{q}_i\}\) 去 attend 上下文;
  • 回归头 \(f_r\) 输出可执行位姿,L1 损失:
\[\mathbf{a}_i = f_r\!\left(\Theta\!\left(\mathbf{q}_i,\ \texttt{ctx}\oplus f_p(\mathbf{p}_t)\right)\right),\qquad \mathcal{L}(\Theta_a)=\frac{1}{N_a}\sum_{i=1}^{N_a}\|\mathbf{a}_i-\mathbf{a}_i^*\|_1\]

post-training architecture Figure 4:post-training 阶段的架构。预训练得到的 motion 先验不再直接输出,而是作为 backbone 内部表征去支撑 action query 的回归。

3.8 UniHand 数据集

来源类型 代表数据集 特点
Motion capture ARCTIC, FPHA, H2O, HOI4D, HOT3D, OAKINK2, TACO, DexYCB 多视角 mocap,3D 标注精度高,但场景 diversity 有限
VR-recorded EgoDex(829 小时,占绝对主导), HoloAssist Apple Vision Pro 等设备 + SLAM 追踪,自然交互 + 可靠 3D GT
Pseudo-annotated Taste-Rob HaMeR 伪标注,噪声大但 scalable、diversity 高

总计:11 个数据源、444.1K 条轨迹、1.3 亿帧、1155 小时、1.665 亿条指令样本。 实际预训练因算力限制采样了均衡子集 UniHand-2.5M

主动排除的数据(值得注意):Ego4D(手频繁遮挡/出画)、EPIC-Kitchens(动态视角)。

标注流水线用 Gemini-2.5-Flash-Lite 做两级标注(chunk 级 ≤10 秒的祈使句指令 + per-second 级 1 秒重叠窗口的接触状态/物体属性/轨迹描述),再用 Gemini-2.5-Pro 从每类约 20 个模板扩展出多样化指令变体。三类任务:instructional motion generation / motion translation / contextual motion prediction。

3.9 Implementation Details

  • tokenizer:8 层 GRQ、group size \(n=2\)、codebook \(K_w=K_f=4096\)、code dim \(d=512\)\(\alpha=4\)每手每秒 128 个 motion token;batch 2048、lr \(2\times10^{-4}\)\(\lambda_1=0.02\)\(\lambda_2=1.0\),EMA 更新 codebook。
  • 主模型:InternVL3 1B/8B/14B,图像 \(448\times448\),MANO-D162 @ 15 FPS,AdamW lr \(1\times10^{-5}\)、batch 128、32 × A800-80G,ViT adapter 与 LLM backbone 联合微调。
  • 真机:7-DoF Franka Research 3 + 6-DoF Inspire 手 + RealSense L515;遥操作用 Gello 外骨骼控制手臂 + D435i 做手部姿态估计与重定向;每任务 50–100 条轨迹。

4. 结果对比

4.1 手部动作生成格式有效率(free-format 模式)

模型 Valid Generation Rate
Being-H0-1B 仅中等
Being-H0-8B 99.8%
Being-H0-14B 100%

说明结构化格式的掌握本身就是一种 scaling 收益 —— 小模型学不会稳定输出合法 motion block。

4.2 真机灵巧操作成功率(每任务 20 次随机化试验)

Task GR00T N1.5 InternVL3(无预训练) Being-H0
Pick-Place-Toy (Seen) 0.75 0.55 0.75
Pick-Place-Toy (Unseen) 0.40 0.55 0.65
Pick-Place-Toy (Clutter) 0.50 0.50 0.60
Close-Toolbox 0.80 0.50 0.85
Close-Lid 0.50 0.25 0.60
Pour-Cup 0.90 0.55 1.00
Unfold-Clothes 0.60 0.45 0.75

关键对照是 InternVL3:同架构同规模,唯一差别是没有手部动作预训练与 physical alignment。Being-H0 在 7 项里全面领先,其中 Close-Lid(0.60 vs 0.25)和 Pour-Cup(1.00 vs 0.55)差距最大 —— 都是要求精细位姿与轨迹平滑度的任务,恰好对应人手动作先验最该起作用的地方。

4.3 数据效率

data efficiency Figure 5:不同 teleoperation 数据量下的成功率。Being-H0(预训练)vs InternVL3(无预训练)。

  • Pick-Place-Toy:Being-H0 用 25% 数据 ≈ baseline 用 100% 数据。
  • Close-Toolbox / Unfold-Clothes:25% ≈ baseline 的 50%。
  • Close-Lid:baseline 在 25% 数据下完全失败(0%),Being-H0 已有 15%。

这是全文最有说服力的一组数字 —— 它把「人类视频预训练」的价值直接换算成了真机数据采集成本的下降

4.4 关键消融

data scaling Figure 6:模型规模与数据规模的 scaling 曲线。

消融维度 结论
Part-level vs 4-group vs 16-layer RQ part-level 在同等 token 数与 codebook 容量下重建最好
MANO 特征 重建最优 ≠ 生成最优;最终选 6D 的 D162;加关节位置 \(j\) 有益,建模 \(\beta\) 有害
模型规模 1B→8B→14B MPJPE / MWTE / PA-MPJPE / M2T R@3 / FID 全线单调改善,tail split 上提升尤其明显
View-balance 增广 提升未见相机配置下的泛化

5. 引申问题 / 讨论

5.1 做得好的地方

  1. 「同构性」诊断是全文的灵魂。把「为什么 VLA 没有复刻 LLM 的 instruction tuning 红利」归因到 pretraining/downstream 数据结构的异构性,这个 framing 比单纯说「数据不够」深刻得多,也直接推导出了「显式建模动作模态」的解法。整个 Being-H 系列后面三代都是在这条推论上做加法。

  2. Part-level tokenization 的动机是数据驱动的,不是拍脑袋。作者先观察到「腕部参数分布跨越整个 3D 空间、重建误差主导整体」,再拆出独立 tokenizer,还顺手发现拆完之后专门的 \(\mathcal{L}_{\text{wrist}}\) 就不需要了 —— 这种「设计消除了自己引入的补丁」是好设计的标志。

  3. 敢于报告「重建最优 ≠ 生成最优」这个反直觉结果,并给出了结构性解释(腕部易学、手指是瓶颈)。很多论文会直接选重建指标最好的配置然后不提这件事。

  4. Physical space alignment 里的几何自洽增广。意识到「随机裁剪/翻转会破坏弱透视一致性」,转而设计 depth scaling(图像反向缩放补偿)和 in-plane rotation(同步旋转位姿与图像),这是真正理解了 2D-3D 耦合关系才写得出来的增广。

  5. InternVL3 作为对照 baseline 选得极好。同架构、同规模、同 post-training 数据,唯一变量是有无手部预训练 —— 这是能干净归因的对照,比跟 GR00T 比更有说服力。

  6. 数据效率实验把学术收益翻译成了工程收益。25% 数据打平 100% 这个数字,对任何要做真机数据采集预算的团队都是直接可用的。

5.2 做得不够好 / 值得质疑的地方

  1. 真机评测规模太小,统计上撑不住结论。每任务 20 trials、7 个任务。0.75 vs 0.55 在 n=20 下的 95% 置信区间是严重重叠的(约 ±0.19),单看任何一项都不显著。论文没做任何显著性检验,"全面领先" 更多是靠 7 项一致的方向性而非单项的强度。

  2. UniHand 的「1155 小时 / 1.665 亿样本」有很大水分。(a) EgoDex 一家就贡献 829.4 小时(占 72%)和 7060 万条指令(占 42%),所谓「11 个数据源的多样性」实际高度集中;(b) 1.665 亿「指令样本」是模板 × Gemini 扩写 × view-balance 增广乘出来的,不是 1.665 亿个独立交互 —— 真实轨迹只有 444K 条;(c) 实际预训练只用了 UniHand-2.5M,即全量的 1.5%。所以标题里的 "Large-Scale" 与真正进入训练的数据量之间差了近两个数量级。

  3. Post-training 方案被作者自己承认是权宜之计,用 MLP 回归头 + L1 loss,明确把 discrete action token 和 diffusion policy 列为 future work。这意味着「预训练的收益」和「post-training 方案的弱」被混在了一起 —— 有可能 Being-H0 的真机数字被一个偏弱的 action head 拖了后腿,也有可能 InternVL3 baseline 同样受害因而对照仍然公平。但读者无法判断,因为没有「同一预训练 + 更强 action head」的对照。(这一点在 Being-H0.5 换成 flow matching 后被间接修正了。)

  4. 动作 token 的信息率高得可疑:每手每秒 128 个 token,双手就是 256 token/秒。一个 10 秒序列光动作就 2560 token。这直接导致长序列生成必须靠 soft-formatted 模式(混入 ground-truth 再重量化)才能维持精度 —— 而 soft-formatted 本质上是在推理时偷看答案,用它报告的长序列指标不能代表真实自回归能力。论文对这一点的表述比较含糊。

  5. 「人手是 foundation manipulator」这个主张只在 Inspire 六自由度灵巧手上验证过。MANO 有 15 个手指关节,Inspire 手只有 6 DoF —— 从 45 维手指旋转到 6 维的重定向是一个信息量剧烈压缩的过程。人手动作先验里究竟有多少在这个瓶颈后还幸存,论文没有分析。对夹爪的适配则完全是一句「wrist motion 可以当 end-effector 先验,前人做过,故不展开」带过。

  6. 主动排除 Ego4D 和 EPIC-Kitchens 削弱了 "web-scale" 的叙事。这两个恰恰是最大、最 in-the-wild 的第一人称数据集。排除理由(遮挡、动态视角)是合理的工程判断,但也意味着 Being-H0 的 pipeline 依赖「手部大部分时间清晰可见 + 相机相对稳定」,离真正的「互联网视频」还有距离。(这个缺口正是 JALA 2602.21736 后来要补的。)

  7. GR00T N1.5 这个对照的公平性存疑。GR00T 的 latent action 是为它自己的训练配方设计的,被搬到 Franka + Inspire 这套 Being-H0 自建硬件上、用 50–100 条轨迹 post-train,很可能没跑在它的最优点上。论文也确实没说 GR00T 的 post-training 超参是否单独调过。

  8. 两级 masking 的超参(\(\mathcal{P}=50\%\)、分位数 \([15\%,95\%]\))没有消融。这两个是相当激进的干预(一半的 step 直接屏蔽掉整个非动作词表),却没有 sensitivity 分析,也没解释为什么是 50% 而不是 30% 或 80%。

  9. 多模态 attention 的「统一」可能被高估。论文强调 vision/text/motion 共享 \(W_Q,W_K,W_V\) 投影,但 motion token 只是词表扩展出来的新 embedding,和视觉 token 走的完全是同一套参数 —— 这跟 π₀ 那种独立 action expert 是两条路线。哪条更好,论文没有对照(Being-H0.5 后来倒戈到了 MoT 双专家路线,某种程度上是对这一设计的自我修正)。

5.3 值得继续探讨的方向

  • 腕部用 axis-angle、手指用 6D rotation 的混合表征 —— 作者自己在 §3.2 明确列为 future work,而且从他们给出的分析看,这几乎是必然能拿到收益的低垂果实。为什么没在这篇里做完?
  • 把 soft-formatted 换成真正的 closed-loop 长序列生成,或者引入 chunk 级 re-anchoring 机制,才能诚实地评估长程能力。
  • 降低 motion token 的信息率:128 token/手/秒 是否必要?能否用类似 FAST 的 DCT+BPE 思路把动作压到 10× 更短?这直接决定了能否把动作 context 拉长到分钟级。
  • 验证「人手先验」在极端形态差异下的存活率:从 MANO 45 维手指到 6 DoF、到 2 指夹爪、到吸盘,先验收益应该有一条衰减曲线,把它画出来会比「我们在灵巧手上有效」有力得多。
  • Ego4D / EPIC-Kitchens 这类 in-the-wild 数据怎么进来 —— 需要能容忍噪声手部标注的训练目标(这正是 JALA 走的路)。
  • motion token 与 action 之间的关系:post-training 阶段 motion 只是作为 backbone 内部先验,没有显式输出。如果让模型同时输出人手 motion 和机器人 action(多任务),会不会让先验保持得更好、抵抗 catastrophic forgetting?

参考资源