跳转至

BeingBeyond(智在无界)全系列 paper reading:31 篇论文的发展脉络与未来预测

系列阅读笔记 — 覆盖 BeingBeyond 自 2024-10 至 2026-07 的全部公开论文

单篇精读:Being-H0Being-H0.5Being-H0.7


0. 这家公司是谁

BeingBeyond(智在无界) 是一家做具身智能基础模型的创业公司,核心班底来自北京大学Zongqing Lu / 卢宗青 是贯穿全部 31 篇论文的通讯作者)与中国人民大学(Qin Jin 组),第一作者群体高度集中在 Hao Luo、Sipeng Zheng、Ye Wang、Wanpeng Zhang、Yicheng Feng、Haoqi Yuan 这几位身上。

判断一篇论文属不属于 BeingBeyond,本文的口径是在 LaTeX 源码里出现 BeingBeyond 署名。按这个口径核查了 34 篇候选,确认 30 篇;再加上一篇只有 NeurIPS proceedings、没有 arXiv 的 OpenMMEgo,以及一篇发表于公司成立前但被 GitHub org 追认为系列起点的 Being-VL-0,共 31 篇。(Zongqing Lu 的另外几篇 —— DualTHOR、EgoTactile、EgoPressDiff、人类视频综述 —— 源码里没有公司署名,本文不计入。)

发表节奏(按 arXiv 首次提交月份):

时间 数量 备注
2024-10 2 Being-M0、Being-VL-0(公司成立前的学术底子)
2025 全年 13 Being-0 开局,H 线与人形线并行铺开
2025-12 5 单月峰值 —— 触觉、空间、可靠性、抓取四线齐发
2026-01 ~ 07 10 Being-H0.5 / 0.7 两代主力 + 方法论批判集中出现

约 22 个月 31 篇,其中 18 篇有明确的顶会归属(ICML×2、CVPR×4、ICCV×2、NeurIPS×4、ICLR×2、ECCV×3、ACM-MM×1)。这个吞吐量在具身创业公司里属于第一梯队,而且开源程度很高 —— Being-H0 的 1B/8B/14B 权重、Being-H0.5 的 2B 权重、UniHand 数据、H-Tac 触觉数据、以及 27 个 GitHub 仓库基本都放出来了。


1. 完整论文索引(31 篇)

1.1 A 线:Being-H / 人本 VLA — 公司的主力产品线(9 篇)

# 论文 arXiv 时间 venue 一句话
A1 Being-H0: VLA Pretraining from Large-Scale Human Videos 2507.15597 2025-07 ICML 2026 把人手 MANO 动作 part-level 量化成 token 扩进 LMM 词表,1155 小时人类视频上做 physical instruction tuning
A2 Being-H0.5: Scaling Human-Centric Robot Learning 2601.12993 2026-01 unified action space 把人手当第 31 种本体,35,000 小时 / 30 本体,MoT + Mixture-of-Flow
A3 Being-H0.7: A Latent World-Action Model 2605.00078 2026-04 prior/posterior 双分支对齐,训练时吃未来、推理时不生成未来帧
A4 VIPA-VLA: Spatial-Aware VLA Pretraining via Visual-Physical Alignment 2512.13080 2025-12 CVPR 2026 双编码器加 3D 视觉分支,从人类视频抽 3D 视觉+3D 动作标注,预训练阶段就对齐 2D 视觉与 3D 物理空间
A5 JALA: Joint-Aligned Latent Action 2602.21736 2026-02 CVPR 2026 放弃像素重建式 latent action,改用「预测嵌入 ↔ IDM latent action」联合对齐;UniHand-Mix 把 Ego4D 野外视频拉进来(7.5M 样本 / 2000+ 小时)
A6 X-DiffVLA: X-Embodied Diffusion Action Heads 2605.25044 2026-05 Embodiment Forcing(CFG 风格)+ Morphological Tree Diffusion,专攻「同底座、异末端」的跨本体动作头
A7 TTP / H-Tac: Human-Centric Transferable Tactile Pre-Training 2607.01067 2026-07 160 小时人类触觉-动作数据(300+ 任务 / 135K episodes),统一触觉空间 + 触觉专家预测未来触觉信号
A8 UniTacHand: Unified Spatio-Tactile Representation 2512.21233 2025-12 把人手(触觉手套)和机器手的触觉都投到 MANO 2D 表面空间,10 分钟配对数据做对比学习,零样本人→机触觉策略迁移
A9 MEgoHand: Multimodal Egocentric HOI Motion Generation 2505.16602 2025-05 NeurIPS 2025 VLM「大脑」+ DiT flow-matching「小脑」双层架构,腕部平移误差降 86.9%

1.2 B 线:方法论与诊断 — 对自己所在赛道的批判(4 篇)

# 论文 arXiv 时间 venue 一句话
B1 Rethink-VLA: Alignment, Mixture, and Regularization 2602.09722 2026-02 RSS 2026 投稿 受控实验证明:EEF-relative 动作表示是跨本体迁移的关键;朴素堆异构数据会负迁移;sensory dropout 与多阶段训练在规模上不必要。提出 Grouped Blind Ensemble 盲测协议
B2 BeTTER: Unmasking the Illusion of Embodied Reasoning 2604.18000 2026-04 ECCV 2026 施加因果干预 + kinematic isolation,证明 SOTA VLA 在动态场景下灾难性失败,存在 lexical-kinematic shortcut、behavioral inertia、semantic feature collapse
B3 DiG: Transport Discrepancy as a Reliability Signal 2512.01715 2025-12 ECCV 2026 用 sliced Wasserstein 传输代价当作 flow-matching VLA 的内生可靠性信号,做残差精化与损失调制
B4 PTR: Conservative Offline Policy Learning via Posterior-Transition Reweighting 2603.16542 2026-03 无奖励的保守 offline post-training:用 transition scorer 估计「动作后果可归因度」的后验,重加权监督回归

1.3 C 线:Being-M / 人体动作生成 — 技术输血的源头(5 篇)

# 论文 arXiv 时间 venue 一句话
C1 Being-M0: Scaling Large Motion Models with Million-Level Human Motions 2410.03311 2024-10 ICML 2025 MotionLib(首个百万级动作数据集,15× 于既有)+ Motionbook(2D lookup-free 动作 tokenizer)
C2 Being-M0.5: A Real-Time Controllable VLMM 2508.07863 2025-08 ICCV 2025 HuMo100M(500 万序列 / 1 亿指令实例 / 部位级标注)+ part-aware residual quantization,首个实时可控 VLMM
C3 RLPF: RL from Physical Feedback 2506.12769 2025-06 ECCV 2026 用物理仿真器里的 motion tracking 策略给文本→动作生成器打分做 RL 微调,把「语义对但物理不可行」的动作拉回可执行域
C4 OpenT2M / MonoFrill 2603.18623 2026-03 CVPR 2026 2800 小时开源动作数据 + 秒级文本标注 + 物理可行性校验;2D-PRQ 按生物学部位切分的 tokenizer
C5 RoPar: Robust Motion Generation using Part-level Reliable Data 2512.12703 2025-12 ACM-MM 2026 身体分五部位、只信「清晰可见」的部位,part-aware VAE + 鲁棒掩码自回归;贡献 K700-M 基准(20 万真实动作序列)

1.4 D 线:人形本体 / 全身控制 / 灵巧抓取(9 篇)

# 论文 arXiv 时间 venue 一句话
D1 Being-0: A Humanoid Robotic Agent with VLMs and Modular Skills 2503.12533 2025-03 公司第一篇:FM(规划)+ Connector(轻量 VLM 桥接)+ 模块化技能库的分层人形 agent,除 FM 外全部可上机载算力
D2 JAEGER: Dual-Level Humanoid Whole-Body Controller 2505.06584 2025-05 粗(根部速度)/细(关节)双层全身控制器,AMASS 重定向 + 课程学习(先监督后 RL)
D3 BumbleBee: From Experts to a Generalist 2506.12779 2025-06 NeurIPS 2025 自编码器聚类把动作按行为相似性分组 → 每簇训专家 → 迭代 delta action 建模补 sim2real → 蒸馏成统一 generalist
D4 DemoGrasp: Universal Dexterous Grasping from a Single Demonstration 2509.22149 2025-09 ICLR 2026 把「抓取」重构成对单条演示轨迹的单步编辑(改腕部位姿=抓哪、改关节角=怎么抓),DexGraspNet 95%,仅训 175 个物体
D5 ProprioPlan: Proprioception-Aware Embodied Planning for Dual-Arm Humanoids 2510.07882 2025-10 双臂人形的本体感知规划
D6 DemoHLM: From One Demonstration to Generalizable Loco-Manipulation 2510.11258 2025-10 仿真里一条演示 → 数据生成 + 模仿学习 → 高层操作策略指挥低层通用 WBC,Unitree G1 上 10 个 loco-manipulation 任务
D7 SENTINEL: Fully End-to-End Language-Action Model for Humanoid WBC 2511.19236 2025-11 语言 + 本体感觉 直接 → 低层动作,无中间表示;flow matching 出 action chunk + 残差头做真机精化
D8 DemoFunGrasp: Universal Dexterous Functional Grasping 2512.13380 2025-12 CVPR 2026 把功能性抓取分解为 grasping style × affordance 两个正交条件,沿用 DemoGrasp 的单步编辑 RL;接 VLM 做指令跟随
D9 FAST: General Humanoid WBC via Pretraining and Fast Adaptation 2602.11929 2026-02 Parseval-Guided Residual Policy Adaptation(正交 + KL 约束的轻量 delta 策略,抗灾难遗忘)+ 质心感知控制

1.5 E 线:Being-VL / Egocentric 感知基础(4 篇)

# 论文 arXiv 时间 venue 一句话
E1 Being-VL-0: From Pixels to Tokens — BPE on Quantized Visual Modalities 2410.02155 2024-10 ICLR 2025 把 BPE 原理用到视觉 token 上,抛弃独立视觉编码器,把结构先验直接写进图像 token
E2 Being-VL-0.5: Unified Multimodal Understanding via Byte-Pair Visual Encoding 2506.23639 2025-06 ICCV 2025 加入频率 + 空间一致性的 priority-guided 编码 + 课程式多阶段训练
E3 EgoDTM: 3D-Aware Egocentric Video-Language Pretraining 2503.15470 2025-03 NeurIPS 2025 轻量 3D-aware decoder 从伪深度图学 3D 感知 + 用基础模型把简短 caption 扩写成含手-物线索的描述
E4 OpenMMEgo: Enhancing Egocentric Understanding for LMMs (无 arXiv) 2025 NeurIPS 2025 OME10M(820 万第一人称视频 QA)+ OMEBench + 语义感知视觉 token 压缩 + 课程学习,权重数据全开源

2. 发展脉络:六条贯穿性的线索

2.1 主轴:「人类数据是物理世界的母语」这一信念的四次升级

整个公司的技术叙事可以压缩成一句话的演进:

Being-M0  (2024-10)  动作是一门外语        →  把人体动作 tokenize 成语言
   │                  MotionLib 100 万条
Being-H0  (2025-07)  人手是 foundation manipulator
   │                  UniHand 1155h / 444K 轨迹,part-level GRQ
   │                  「预训练-下游同构性」诊断
JALA      (2026-02)  野外视频也能用        →  放弃像素重建,改隐空间联合对齐
   │                  UniHand-Mix 7.5M(含 Ego4D 2.5M)
Being-H0.5(2026-01)  人手是第 31 种本体    →  unified action space
   │                  UniHand-2.0 35,000h / 30 本体 / 400M 样本
Being-H0.7(2026-04)  人类视频里有「未来」  →  latent world-action model
                      prior/posterior 双分支对齐

值得注意的是信念的表述在不断软化、也在不断变得可操作

  • Being-H0 说「人手是黄金标准的灵巧操作器」—— 这是一个关于人手特殊性的论断;
  • Being-H0.5 说「人手是 unified action space 里的一种广义本体」—— 人类数据在架构上丧失了特殊地位,它就是第 31 种本体,腕部位姿进 EEF 槽位、手指进 fine-manipulation 槽位;
  • Being-H0.7 更进一步,人类视频的价值从「提供动作标签」变成「提供未来观测」,用来塑造潜在推理空间。

这个演进方向是从「人手的形态先验」滑向「人类交互的因果/时序先验」。形态先验会被机器人形态差异稀释(MANO 45 维手指 → Inspire 6 DoF 是剧烈的信息压缩),而因果与时序先验不会。从技术判断上看,这个滑动是对的。

2.2 数据飞轮:从「用公开数据」到「造数据管道」

数据集 论文 规模 性质
UniHand Being-H0 1155h / 444K 轨迹 / 166M 指令样本(实用 2.5M 子集) 11 个公开数据源聚合 + Gemini 标注流水线
UniHand-Mix JALA 7.5M 样本(5M 实验室 + 2.5M 野外) 首次把 Ego4D 野外视频拉进来
UniHand-2.0 Being-H0.5 35,000h / 400M 样本 / 30 本体 / 120B token 16,000h 人类 + 14,000h 机器人 + 5,000h VL
UniCraftor Being-H0.5 200h / 43 任务 自研便携采集系统,含深度、关键帧事件、精确外参,模块化预留触觉位
H-Tac TTP 160h / 300+ 任务 / 135K episodes 自采触觉-动作数据
MotionLib → HuMo100M → OpenT2M Being-M0/M0.5/OpenT2M 100 万 → 500 万序列 → 2800 小时开源 动作生成侧的同步扩容
OME10M OpenMMEgo 820 万第一人称视频 QA 从 Ego4D 合成
K700-M RoPar 20 万真实动作序列 新基准

关键转折在 UniCraftor:从这里开始,BeingBeyond 不再只是「聚合别人的数据」,而是在造自己的数据采集硬件与流水线。而且 Being-H0.5 明确写了这个系统「specifically designed to accommodate diverse and flexible viewpoints, as well as future tactile information」—— 这是一句预告。半年后 TTP 的 H-Tac(160 小时触觉)就落地了。

这条飞轮的另一半是「数据质量」:Being-H0 主动排除了 Ego4D(手部遮挡/出画)和 EPIC-Kitchens(动态视角),因为它的 pipeline 需要可靠的 MANO 标注。JALA 的整个存在理由就是补上这个缺口 —— 它放弃对精确手部标注的依赖,改用联合对齐,于是 Ego4D 的 1123 小时得以进入训练。OpenT2M 走的是同一条路的另一侧:物理可行性校验 + 多粒度过滤,用质控而非放弃标注来解决噪声。RoPar 则是第三条路:部位级可信度 —— 只信看得清的部位,看不清的直接忽略。

同一个「野外数据噪声」问题,被三篇论文用三种不同方式解决过,这是一个团队真的在啃这个问题的标志。

2.3 Tokenizer 谱系:一个关于「部位化」的技术执念

这是全系列最清晰、也最少被外界注意到的技术连续性:

Being-M0   Motionbook:2D lookup-free 动作 tokenizer,紧凑无损特征
Being-H0   part-level GRQ:腕部 {r_rot, τ} 与手指 {θ, β} 各用独立 tokenizer
    │      动机:腕部参数分布跨越整个 3D 空间,混在一起量化会被腕部主导
Being-M0.5 part-aware residual quantization:身体部位级的精细控制
OpenT2M    2D-PRQ:按「生物学部位」切分身体,捕捉时空依赖
RoPar      身体分五部位 + part-aware VAE + 部位级掩码生成

「把身体拆成语义部位、分别量化」 是贯穿 M 线和 H 线的统一信念,而且这个信念还外溢到了别的地方 —— Being-H0.5 的 unified action space 本身就是部位化思想在跨本体上的推广(双臂 EEF、关节位置、夹爪开度、手指关节、底盘速度各占语义隔离的槽位),ESA 的 slot-wise adapter 更是把「按部位共享参数」做成了跨本体迁移机制:同一手臂配不同的手,手臂槽位自动共享。

UniTacHand 也是同一思路的触觉版 —— 把人手和机器手的触觉都投到 MANO 的 2D 表面空间,用形态一致的表面参数化消解异构性。

2.4 架构路线的一次公开倒戈

代次 动作表示 架构 动作头
Being-H0 离散 motion token(扩词表) 单塔,vision/text/motion 共享 \(W_Q,W_K,W_V\) MLP 回归 + L1
Being-H0.5 连续动作(unified action space) MoT 双专家(Understanding + Action) Rectified Flow
Being-H0.7 连续动作 + latent query MoT 双专家 + prior/posterior 双分支 Flow matching

Being-H0 的核心卖点是「动作是第四种语言、和视觉文本共享同一套 attention 参数、纯自回归」—— 这是很纯粹的 LLM 原教旨主义。仅仅半年后,Being-H0.5 就倒戈到了 π₀ 的架构共识(双专家 + flow matching),论文里还专门写了一句「this dual-expert paradigm ... aligning with the architectural consensus established by recent state-of-the-art models such as π₀」。

有意思的是两篇论文都没有正面讨论这次转向 —— 没有「统一 token vs 双专家」的对照实验,没有解释为什么放弃。离散手部动作在 H0.5 里还保留着 masked token prediction,成了一个混合体,其必要性同样没有消融。

这是全系列在实验严谨性上最大的欠账之一,但从工程判断上,这次倒戈几乎肯定是对的:离散 token 在动作精度和推理延迟上的劣势,2025 年下半年已经被 OpenVLA-OFT、π₀ 系列反复验证过了。

2.5 从「刷成功率」到「做方法论」:一次可见的成熟

这条线索最能说明这个团队的质量。

2025 年的实验风格:Being-H0 的真机部分是「7 个任务、每任务 20 trials、报个成功率表」,没有显著性检验,没有盲测,评测者知道在测哪个模型。

2026 年发生了三件事

  1. Rethink-VLA (2602.09722) 提出 Grouped Blind Ensemble —— 操作员对模型身份盲、策略执行与结果判定分离,明确目标是「reducing experimenter bias」。同时这篇论文做的是一系列否定性结论:朴素堆数据会负迁移、sensory dropout 没用、多阶段训练不如直接端到端。一家公司发论文说「我们赛道上大家默认有效的三件事,其实有两件没用」,这是需要一点底气的。

  2. BeTTER (2604.18000) 更狠 —— 直接论证 SOTA VLA 的「具身推理」在很大程度上是幻觉:施加因果干预(空间布局变化、时间外推)并做 kinematic isolation 后,SOTA 模型灾难性失败,暴露出 lexical-kinematic shortcut、behavioral inertia、semantic feature collapse,并把病根追到架构瓶颈(capacity compression、myopic downsampling)。结论是「静态评测协议在系统性地掩盖表征退化」。

  3. Being-H0.7 真的用上了:统一黑盒 inference server、随机化被测 endpoint 与 rollout 顺序、操作员盲测、二值判定、每任务 20 blind trials。

内部的方法论批判被产品线吸收了 —— 这在论文工厂式的机构里是很少见的。

但也留下一个尴尬:BeTTER 论证 LIBERO 这类静态 benchmark 会掩盖问题,而 Being-H0.5/0.7 的头号卖点仍然是 LIBERO 98.9% / 99.2%。好在 H0.7 补上了 LIBERO-plus、RoboTwin-Hard 这类扰动 benchmark,算是部分自洽。

2.6 一个尚未被承认的内部矛盾

Rethink-VLA vs Being-H0.5,相差一个月,共享 4 位作者,结论方向相反。

  • Being-H0.5(2026-01):35,000 小时、30 种本体、200× 扩容 → LIBERO 98.9%、RoboCasa 53.9% SOTA。叙事是「scaling works」。
  • Rethink-VLA(2026-02):累积混合协议 D1(OXE only) → D2(+真机 EEF) → D3(+仿真 EEF) → D4(+关节),RoboCasa 上 54.7% → 48.8% → 略回收 → 仍比 D1 低近 5pp;LIBERO 上 77.3% → 73.8% → 72.1%。叙事是「naively pooling heterogeneous robot datasets induces destructive interference」。

善意解读(我认为也是正确的解读):Rethink-VLA 恰恰是 Being-H0.5 三大组件的存在性理由——

  • 正因为朴素池化会互相干扰 → 才需要 unified action space 做结构化对齐;
  • 正因为不同本体的最优速度场方向失配 → 才需要 MoF 稀疏路由ESA 槽位级隔离做容量隔离;
  • Rethink-VLA 确认 EEF-relative 是最可靠的表示 → Being-H0.5 的 unified action space 正是「统一世界系下的相对 delta 位移 + Axis-Angle」。

但 Being-H0.5 一个字都没提这个论证,也没有做「有/无 unified action space 下的数据 scaling 曲线」对照。结果是:读者无法判断 53.9% 究竟来自 200× 数据,还是来自这三个组件在对抗数据干扰。这是全系列最大的归因漏洞,也是最容易补上的一个实验。


3. 结构性观察:两座塔,一座桥还没修好

把 31 篇论文摊开看,最醒目的结构特征是两条几乎不相交的技术栈

        A 线(操作 / VLA)                     D 线(本体 / 控制)
   ┌────────────────────────────┐      ┌────────────────────────────┐
   │ Being-H0 → H0.5 → H0.7     │      │ Being-0(分层 agent)       │
   │ JALA, VIPA-VLA, X-DiffVLA  │      │ JAEGER → BumbleBee → FAST   │
   │ TTP, UniTacHand, MEgoHand  │      │ DemoGrasp → DemoFunGrasp    │
   │                            │      │ DemoHLM, SENTINEL           │
   │ 方法:大规模预训练 + BC/flow │      │ 方法:RL + sim2real + 蒸馏  │
   │ 数据:人类视频              │      │ 数据:AMASS 重定向 + 仿真    │
   │ 输出:上身操作动作          │      │ 输出:全身关节力矩           │
   └────────────────────────────┘      └────────────────────────────┘
                    ↑                              ↑
                    └──────── 桥在哪里? ──────────┘

Being-0(2025-03)本来就是那座桥 —— 它的三段式(FM 规划 + Connector 桥接 + 模块化技能库)明确要把高层认知和低层技能缝起来,Connector 这个轻量 VLM 就是为了解决「直接把 FM 接到技能库上会因长程复合误差和模块延迟不一致而崩掉」。

但此后一年多,两条线各自狂奔,桥没有再修。

最能说明问题的细节在 Being-H0.7 的真机部分:在 Unitree G1 上,H0.7 只输出 26-DoF 上身动作接口,底层 50Hz 全身平衡交给了 AMO —— 一个外部工作。而 BeingBeyond 自己有 JAEGER、BumbleBee、FAST、SENTINEL 四篇全身控制论文,一篇都没用上。

这不是疏忽,而是两条线的接口还没统一:A 线的动作空间是「统一世界系下的 EEF 相对 delta + 手指关节弧度」,D 线的动作空间是「关节力矩 / 全身运动指令」。中间缺一层。

这个缺口,我认为就是 BeingBeyond 下一步最重要的工作,也是本文预测的主要依据。


4. 大胆预测:接下来 12–18 个月会发生什么

以下预测按我判断的置信度从高到低排列。每条都给出支撑证据,方便日后回来打分。

4.1 【高置信】Being-H1 会是「操作 + 全身」的合体,A 线吞并 D 线

预测:下一代主力模型(无论叫 Being-H1 还是别的)会用一个 checkpoint 同时输出上身操作动作和全身控制指令,把 FAST/BumbleBee 那套 WBC 能力直接吸进 unified action space 的槽位里。

证据链

  1. Being-H0.5 的 unified action space 已经预留了底盘槽位("mobile base velocity and heading commands")—— 从 EEF/关节/夹爪/手指扩展到腿部关节只是槽位的自然延伸;
  2. Being-H0.7 已经跑在 Unitree G1 和 PND Adam-U 上,但被迫外接 AMO —— 这是一个团队自己一定不满意的状态;
  3. SENTINEL(2511.19236)已经把这条路探通了 —— 语言 + 本体感觉直接到低层全身动作,flow matching 出 action chunk + 残差头精化,架构语言和 A 线完全一致(flow matching + chunk + 残差)。SENTINEL 看起来就是 A 线架构在 D 线上的试点;
  4. FAST(2602.11929)的 Parseval-Guided Residual Policy Adaptation 是为「快速适配 + 抗灾难遗忘」设计的 —— 这正是把一个大预训练模型接到新本体上时需要的东西;
  5. DemoHLM 已经验证了「高层操作策略指挥低层通用 WBC」的分层可行性,缺的只是把高层换成 Being-H。

反过来说,如果 12 个月后 Being-H 系列仍然只管上身、底层仍然外接别人的控制器,那说明这个接口问题比我判断的难得多。

4.2 【高置信】触觉会成为 unified space 里的第四模态,并接管 H0.7 的 posterior 分支

预测:触觉从「一个额外的输入通道」升级为与 vision/language/action 并列的一等模态,写进 unified state-action space;同时,H0.7 的 posterior 分支会从「看未来 RGB」换成或扩展为「看未来触觉序列」。

证据链

  1. Being-H0 的 §3.3.3 就已经预告了:「incorporating visual depth information, tactile feedback, or other multi-sensory signals ... tactile feedback could capture crucial contact dynamics, grip forces, and material properties that are invisible in visual observations」;
  2. UniCraftor 明确「designed to accommodate ... future tactile information」
  3. UniTacHand(2025-12)已经解决了表示问题 —— 人手手套触觉和机器手触觉统一投到 MANO 2D 表面空间,10 分钟配对数据即可对齐,零样本人→机迁移;
  4. TTP(2026-07,最新一篇)已经解决了预训练问题 —— H-Tac 160 小时 / 135K episodes,统一触觉空间 + 统一动作空间贯穿 pre-train 与 post-train,而且用的正是双专家架构:action expert 出未来动作 chunk,tactile expert 预测未来触觉信号
  5. TTP 的「tactile expert 预测未来触觉」与 H0.7 的「posterior 分支编码未来观测」在结构上是同一件事 —— 两者合并是最小改动、最大收益的一步。触觉恰恰是视觉看不到但对动作极其有用的特权信息,比未来 RGB 更适合做 posterior。

这条预测的时间点我押得比较近 —— TTP 是 2026-07 的论文,是全系列最新的一篇,通常最新论文就是下一代的组件预告。

4.3 【中高置信】RL post-training 会进入 A 线,PTR 是第一块砖

预测:Being-H 系列会引入真实世界的 RL / 经验学习后训练,脱离纯 behavior cloning。

证据链

  1. 整个 A 线目前是纯 BC(L1 回归 → flow matching),天花板明显 —— Being-H0.7 在 RoboCasa 上 62.1%、GR1 上 49.2%,离产品可用还很远,而 π 系列已经用 RECAP(π*₀.₆)验证了 RL 后训练能突破 BC 上限;
  2. PTR(2603.16542)是显式的过渡形态 —— 它是「reward-free、conservative」的 offline post-training,用后验可归因度重加权监督回归。这是从 BC 走向 RL 的第一步:还不敢用奖励,但已经开始区分样本价值了。而且论文明确说它「compatible with both diffusion and flow-matching action heads」—— 就是为 A 线的动作头准备的;
  3. D 线有极其丰富的 RL 经验 —— JAEGER、BumbleBee、DemoGrasp、DemoFunGrasp 全是 RL,DemoGrasp 那个「把长程探索重构成单步 MDP 编辑」的技巧尤其漂亮;
  4. RLPF(2506.12769)已经在 C 线做过一次跨界 —— 用物理仿真器的 tracking 策略给生成模型打分做 RL 微调。同样的模式(用一个 critic 给大生成模型打分)搬到 VLA 上是直接的。

不确定的是形态:是像 RECAP 那样的 value-based 真机 RL,还是更保守的「离线重加权 + 少量在线修正」。考虑到 PTR 的保守取向,我押后者先来。

4.4 【中置信】显式 world model 与 latent world model 会合流

预测:下一代会训练时同时做像素/视频预测和 latent 对齐、推理时只留 latent,即 Fast-WAM 路线与 Being-H0.7 路线的合体。

证据链

  1. Being-H0.7 自己的表格暴露了短板 —— RoboCasa 上 62.1% 输给 Cosmos-Policy 的 67.1%(而且 Cosmos 只有 2B,比 H0.7 的 3B 还小);RoboTwin 上 90.2/89.6 输给 LingBot-VA 的 92.9/91.6 和 Fast-WAM 的 91.9/91.8。论文把这些数字如实列出但没有分析 —— 这通常意味着团队内部知道问题在哪;
  2. 这些反例直接挑战了 H0.7「像素预测是昂贵且间接的底座」的核心论断 —— 至少在某些 benchmark 上,显式未来生成买到了 latent 对齐买不到的东西
  3. H0.7 的相关工作章节里对 Fast-WAM 的描述非常准确、也很尊重(「shows that retaining video co-training during training while removing test-time future generation can preserve strong action performance with substantially lower latency」),说明他们研究得很仔细;
  4. 技术上这个合并几乎没有阻力 —— posterior 分支加一个像素重建头即可,推理时照样丢掉。

4.5 【中置信】模型会往小走而不是往大走,边缘部署是硬约束

预测:Being-H 系列的主力规模会稳在 2B–4B,不会去追 7B/10B+;MoF 的稀疏激活会被进一步强化,Orin-NX 级别的边缘部署会成为公开的硬指标。

证据链

  1. 规模轨迹本身就在说话:Being-H0 有 1B/8B/14B 三档,Being-H0.5 主力是 2B,Being-H0.7 是 3B —— 在同行普遍往 3B→4B→7B 走的时候,他们从 14B 退回到了 2B;
  2. Being-H0.5 明确把 MoF 的「总参数与激活参数解耦」 说成是「makes Being-H0.5 highly deployable on resource-constrained edge hardware, such as the NVIDIA Orin-NX」;
  3. Being-H0.5 把 "Real-Time Infrastructure" 列为四大贡献之一,Being-H0.7 报 3–4 ms/step
  4. Being-0 从第一篇起就坚持「除 FM 外全部组件可部署在低成本机载算力上」—— 这是刻在公司基因里的约束;
  5. 商业逻辑:一家要卖机器人(而不是卖 API)的公司,推理成本直接吃毛利。

唯一的反向风险:如果 BeTTER 诊断出的「capacity compression」瓶颈真的需要更大模型才能解,他们可能被迫放大。但从 MoF 的设计看,他们的答案是「用稀疏专家扩容量、而非稠密扩参数」。

4.6 【中置信】数据采集系统会产品化 / 开放

预测:UniCraftor 会被做成可对外的产品或开源硬件方案,配合众包式的人类演示数据采集。

证据链

  1. Being-H0.5 描述 UniCraftor 时用了 "portable, plug-and-play"、"intentionally modular and extensible" 这类明显不是学术措辞的词;
  2. 论文承诺开源包含「model weights、training pipeline、simulation scripts、real-world deployment infrastructure、以及 1,000 GPU-hour 预训练配方」—— 这是在铺生态而不是守秘密;
  3. 整个 A 线的瓶颈是人类数据规模,而人类数据的边际采集成本远低于遥操作数据 —— 谁能把采集设备铺出去,谁就有数据护城河;
  4. GitHub org 里已经有 Beingbeyond_D1_edu(D1 机器人教育版 SDK)和 Beingbeyond_D1 —— 说明他们已经在做面向外部用户的硬件产品线。

4.7 【中低置信】评测方法论会被包装成公开资产

预测:BeTTER + Grouped Blind Ensemble + 黑盒盲测 inference server 会被整合成一套公开的 VLA 评测标准 / 排行榜。

证据:三篇论文(Rethink-VLA、BeTTER、Being-H0.7)分别贡献了协议、诊断基准和部署栈,三者拼起来正好是一套完整的评测方案;而且 BeTTER 已经以 benchmark 形态发布。在一个人人都在刷 LIBERO 且已经饱和的赛道上,「定义怎么评测」是很有价值的话语权。

置信度我给得不高,因为这件事的商业回报不直接,创业公司未必有余力。

4.8 【低置信 / 反向预测】Being-VL 线大概率不会复活

预测:视觉 BPE 这条线(Being-VL-0 / 0.5)已经实质性终止,不会有 Being-VL-1。

证据

  1. 这条线最后一篇是 2025-06(ICCV 2025),此后 14 个月没有后续;
  2. Being-H 系列的 backbone 一路是 InternVL3 → InternVL-3.5,视觉编码器 H0.7 换成了 V-JEPA2.1 —— 全部是外部现成模型,没有一处用自家的 BPE 视觉 tokenizer
  3. Being-H0.5 承认「the choice of the VLM backbone is critical」并说打算「systematically benchmark alternative backbones in future exploration」—— 语气是「我们要挑一个好的现成 backbone」,不是「我们要自己做一个」;
  4. 从资源配置角度,一家具身创业公司自研通用多模态 backbone 的性价比极低。

这条线更可能的归宿是:作为学术资产保留,技术并入 E 线的 egocentric 理解(OpenMMEgo 已经在做 Qwen2.5-VL 的第一人称增强),服务于 A 线的 backbone 选型。

4.9 【值得关注的暗线】三条可能的意外方向

这些我没有足够证据给置信度,但都有伏笔:

  • H0.7 的 prior-posterior 差距当作不确定性信号 —— \(\|h^{\text{prior}}-h^{\text{post}}\|\) 训练时可算、推理时不可算,但可以训个小 head 去预测它。这与 DiG 的 gateMPG 的 SWD 门控是同一类思路,三者合并会得到一个统一的「策略自知之明」模块,可用于 OOD 检测、ask-for-help、安全兜底。DiG → MPG 的演化已经发生了一次(H0.5 明确说 MPG 改自 DiG-Flow 并给出方差论证),第三次演化是自然的。
  • DemoGrasp 的「单步 MDP 编辑」思想外溢到操作 —— 把长程高维探索重构成对单条演示的一步编辑,这个技巧在抓取上拿到了 95% / 84.6% 跨本体成功率,而且已经复用到 DemoFunGrasp 和 DemoHLM。它本质上是一种极强的动作空间降维,理论上可以套到任何有「一条参考轨迹 + 需要泛化」结构的任务上。
  • Being-0 的 Connector 会以新形态回归 —— 当 A 线模型大到需要考虑「什么时候调用大模型、什么时候用快速反射」时,Connector 那种「轻量 VLM 做高低层桥接 + 动态协调 locomotion 与 manipulation」的设计会重新变得必要。现在的分层是 AMO 那种硬编码的接口,未来大概率要换成学出来的。

5. 如果我是这个团队,我会先做这三个实验

按「投入产出比」排序,都是现有材料就能做、且能解决系列最大疑点的:

  1. 补上 unified action space × 数据 scaling 的 2×2 网格。在有/无 unified action space 两种设定下,重跑 Rethink-VLA 的 D1→D4 累积混合协议。这一个实验同时回答两件事:Being-H0.5 的 53.9% 有多少来自数据、多少来自架构;以及 Rethink-VLA 的「负迁移」诊断是否真的被 unified action space 治好了。这是全系列最大的归因漏洞,也是最容易补的。

  2. Being-H0.7 的 \(w_{\text{align}}=0\) 消融。保留 latent query、关掉未来信息注入。如果这个 baseline 拿到大部分收益,那 H0.7 的故事就得从「latent world model」改写成「增加有效推理深度」。这是整篇论文核心主张的唯一致命对照,现在缺失。

  3. MoF 的路由决策可视化。不同本体/任务实际路由到哪些专家?如果按技能聚类,说明真学到了可迁移运动基元,MoF 的叙事成立;如果按本体聚类,MoF 就退化成了带软共享的 per-robot head —— 而 per-robot head 恰恰是 Being-H0.5 花了整节篇幅批评 GR00T 的做法。这个实验有把论文核心贡献证伪的风险,但正因如此它才值得做。


6. 一句话总结这家公司

BeingBeyond 押的是一个非常清晰、也非常大的赌注:机器人数据永远不够,所以要把人类当作数据源 —— 从人手动作(Being-H0)、到跨本体统一动作空间里的一种广义本体(Being-H0.5)、再到人类视频里隐含的未来结构(Being-H0.7)。这条路线在 22 个月里迭代了四代、扩了 200 倍数据、并且在同一时期发论文论证自己赛道上一半的通行做法是无效的(Rethink-VLA、BeTTER)。

他们最强的地方是技术信念的连贯性(部位化 tokenization、人本先验、统一动作空间三条线索贯穿始终)和自我批判的诚实度(盲测协议真的用上了)。最弱的地方是归因实验的缺失 —— 每一代都同时换掉数据、架构、backbone 三样东西,导致「哪一步真的有用」始终说不清楚。

下一个 checkpoint 值得盯的三件事:上身与全身控制会不会合并、触觉会不会进主干、BC 会不会让位给 RL


参考资源