跳转至

Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization

论文阅读笔记 — 用于后续讨论的概览

Being-H 系列第二代。前作 Being-H0 (2507.15597),系列脉络见 BeingBeyond 系列总览


1. 基础信息

  • 题目: Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization
  • 作者: Hao Luo, Ye Wang, Wanpeng Zhang, Sipeng Zheng, Ziheng Xi, Chaoyi Xu, Haiweng Xu, Haoqi Yuan, Chi Zhang, Yiqing Wang, Yicheng Feng, Zongqing Lu — BeingBeyond(智在无界)+ 北京大学
  • arXiv 编号: 2601.12993(submitted 2026-01,44 页技术报告)
  • 权重: https://huggingface.co/BeingBeyond/Being-H05-2B(含 LIBERO / RoboCasa 变体)
  • 关键词: cross-embodiment, unified action space, Mixture-of-Transformers, Mixture-of-Flow, flow matching, manifold-preserving gating, async chunking, UniHand-2.0

teaser Figure 1:Being-H0.5 的定位 —— 一个 checkpoint 横跨 5 种物理形态(从桌面机械臂到轮式半人形到全尺寸人形),全部走同一套 unified action interface。这是从 Being-H0 的「单一 Franka+Inspire」到「跨本体 generalist」的跃迁。

2. 文章介绍

2.1 解决的领域和问题

主线从 Being-H0 的「灵巧手数据稀缺」转移到「跨本体泛化」。论文开篇的类比很直接:

不同机器人的运动空间,本质上是不同的物理语言(physical languages)

对应的问题被形式化为一个多语言迁移问题:

How can robotic intelligence master a new platform with limited data, much like a human learning a minor language?

当前 VLA 是 monolingual speaker —— 在特定硬件上很强,换个形态就废。对 diffusion/flow-based VLA 尤其严重:在夹爪上预训练的模型遇到灵巧手的高维向量场时会发生严重 distribution shift,推理轨迹从合法运动流形上「漂移(drift)」出去,产生抖动。

2.2 Motivation

两个核心概念,都是从 NLP 多语言预训练类比过来的:

  • Human-Centric Learning:正如不同人类语言共享底层语法,不同机器人遵循同一套物理定律。人类交互数据是物理世界的 "mother tongue"(母语)/ lingua franca —— 它提供的因果交互逻辑和接触物理,在所有运动学「方言」之间是不变量。
  • Unified Action Space:把不同机器人的动作表示成共享物理词表里的 token,让低资源、复杂的机器人能从数据丰富的平台和人类演示中 bootstrap 运动技能。

2.3 之前工作的问题

类别 代表工作 缺陷
单本体 VLA π₀, OpenVLA monolingual,换形态即失效;每个平台要单独的数据与 checkpoint
Per-embodiment action head GR00T N1 用独立 MLP 投影层绕开维度差异,回避了底层结构错配 —— 浪费模型容量、割裂物理共性的学习,无法形成 proprioceptive-aware reasoning
混合旋转表示 多数现有数据集 欧拉角/四元数/轴角混用,网络把算力浪费在无意义的格式差异上,引入噪声、破坏训练稳定性
单平台 async chunking RTC (Real-Time Chunking) 只针对单一平台实例化,无法覆盖控制周期与延迟预算各异的异构机队

2.4 论文解决方案(一句话)

用一个物理可解释的 unified state-action space(把人手 MANO 也当成一种「广义本体」映射进去)统一 30 种本体 + 人类数据共 35,000 小时,在 MoT 双专家架构上加一层 Mixture-of-Flow 稀疏路由扩容 action expert,再用 Manifold-Preserving Gating(抗感知漂移)和 Universal Async Chunking(抗异构延迟)把跨本体策略真正推到真机上。

2.5 与前序工作的关系

  • 直接建立在 Being-H0 之上:UniHand-2.0 是 UniHand 的扩展(200× 规模),"physical semantic alignment" 原则也来自 Being-H0。
  • 架构上倒戈到 π₀ 路线:Being-H0 是「motion token 扩词表 + 共享 attention」的纯自回归;Being-H0.5 改成 MoT 双专家(Understanding Expert + Action Expert)+ Rectified Flow 连续动作头,这与 π₀ 的架构共识对齐,也等于部分否定了 Being-H0 的统一 token 路线
  • MoT 结构参照 BAGEL,backbone 换成 InternVL-3.5(Being-H0 用的是 InternVL3)。
  • MPG 直接改自同门的 DiG-Flow(2512.01715),UAC 扩展自 π 系列的 Training-Time RTC
  • 与 Rethink-VLA(2602.09722)构成微妙张力 —— 见 §5.2 第 1 条。

3. 方法介绍

architecture Figure 2:Being-H0.5 架构。MoT 把 Understanding Expert(多模态理解 + 长程规划)和 Action Expert(运动生成)解耦,但两者共享同一条 token 序列和逐层 self-attention。右侧的 Mixture-of-Flow 用 shared foundation 层 + 路由专家层扩展动作容量。

3.1 Unified State-Action Space

核心批判:GR00T 那种「每个本体一个独立 MLP 头」的做法是次优的 —— 它消耗模型容量、割裂物理共性的学习。实际上不同夹爪和灵巧手在 EEF 轨迹上有高度几何一致性,很多关节配置也有内在对齐潜力,用独立头把它们隔离开就丧失了共享先验。

方案:state 和 action 都是定长高维向量,划分成语义隔离的子空间,每一维对应一个有物理意义的量 —— 双臂 EEF 位姿、关节位置、夹爪开度、手指关节、移动底盘速度与朝向。

关键创新 —— 把人手当作 generalized embodiment:MANO 参数直接映射进这个统一空间:

  • 人手全局腕部位姿 → 机器人 EEF 子空间
  • 人手手指关节 → 保留的 "fine-manipulation" 槽位

标准化规则(很实在的工程决策):

维度 规则
Cartesian 控制 一律用统一世界坐标系下的相对 delta 位移
旋转 一律 Axis-Angle(避免 gimbal lock,SE(3) 上插值平滑)
关节空间 绝对弧度
归一化 拒绝传统统计归一化(缩放到 [-1,1]),只做 outlier 过滤

最后一条是有观点的:作者认为「1 弧度」或「10 厘米」本身携带内在物理含义,归一化会把它抹掉。保留真实物理尺度才能让策略在不同本体和环境间物理接地。

3.2 Mixture of Flow (MoF)

问题:unified action space 解决了表示冲突,但 action expert 的容量仍是瓶颈 —— VLA 里 action expert 的参数量通常远小于视觉生成里的 flow expert。

两个观察支撑设计: 1. 很多本体共享部分控制结构(Franka 与 Kuka 都是 N-DoF 机械臂;轮式半人形与移动平台共享底盘速度/朝向)。 2. 人类运动控制本身是模块化的 —— 通用运动基元被动态适配到具体任务。

两层结构:

  • Foundation Experts(共享动力学):action expert 前几层是所有输入共享的标准 transformer block,编码跨本体不变的运动基元(reaching、grasping dynamics、collision avoidance)。
  • Specialized Experts(本体 & 任务路由):上层是并行专家 + 可学习 gating,Top-K 稀疏激活。

收益:训练时某任务的梯度只更新对应专家通路,保住其他技能的权重;推理时总参数量与激活参数量解耦,使得模型能部署到 NVIDIA Orin-NX 这类边缘硬件。

3.3 Embodiment-Specific Adaptation (ESA)

从 flow matching 视角形式化 —— 每个本体 \(e\) 诱导不同的可行动作集,action expert 学一个本体条件速度场:

\[\min_\theta \mathbb{E}_e \mathbb{E}_{(\mathbf{a}_0,H)\sim\mathcal{D}_e} \mathbb{E}_t \left\| v_\theta(\mathbf{a}_t; H, e) - v^*(\mathbf{a}_t,\mathbf{a}_0)\right\|_2^2\]

当不同本体的最优场差异很大时,\(\nabla_\theta\mathcal{L}_e\) 之间方向失配(morphological interference),收敛变慢、复杂硬件上出现「平均化」的不稳定行为。

ESA 的做法(再次拒绝 per-robot 独立头):设 \(\mathcal{S}=\{1,\dots,K\}\) 为语义动作槽位,\(\mathcal{I}_e\subseteq\mathcal{S}\) 为本体 \(e\) 的活跃槽位。维护 slot-wise adapter bank \(\mathbf{W}_{\text{ESA}}\in\mathbb{R}^{K\times d_{\text{out}}\times d_{\text{in}}}\),只更新活跃槽位对应的参数:

\[\mathbf{W}_{\text{ESA}}^{(e)}\triangleq\{\mathbf{W}_{\text{ESA}}[k]: k\in\mathcal{I}_e\},\qquad \Delta\mathbf{W}_{\text{ESA}}[k]=\mathbf{0}\ \ \forall k\notin\mathcal{I}_e\]

共享硬件组件的本体(如同一手臂配不同的手)槽位集合重叠,因而自动共享一部分适配参数 —— 这是相对 per-robot head 的实质进步:共享是组件级而非全有或全无。

3.4 Manifold-Preserving Gating (MPG)

MPG and UAC Figure 3:左 MPG —— 用 SWD 度量观测嵌入与动作先验锚点的分布差异,得到可靠性 gate \(g\),只缩放 feature-conditioned 残差,保留一个 ungated 的 learned prior offset 作为兜底。右 UAC —— 按本体特定延迟 \(d\) 把 action chunk 切成已提交前缀和预测后缀,双线程 buffer 支持异构延迟下的异步推理。

动机:flow matching 隐含假设上下文特征 \(H\) 忠实捕捉了任务语义。分布漂移(光照、视角扰动、遮挡)下策略会盲目地从退化特征回归动作。在 flow 的去噪更新 \(\mathbf{a}_{t-\Delta t}=\mathbf{a}_t+\Delta t\, v_\theta(\mathbf{a}_t;H)\) 中,\(H=H^\star+\epsilon\) 的扰动会诱导正比于 \(\|\partial v_\theta/\partial H\|^2\mathrm{Var}(\epsilon)\) 的动作方差 —— 表现为抖动,并在迭代精化中被放大。

门控残差 + 未门控先验偏置

\[\tilde H = H + \lambda\, g\, \mathbf{W}_{\text{MPG}}\mathcal{E}_{\text{obs}}(H) + \lambda\, \mathbf{b}_{\text{MPG}}\]
  • \(g\approx1\):信任当前上下文,允许强特征条件适配;
  • \(g\approx0\):抑制特征依赖项,回落到稳定的 learned prior offset \(H+\lambda\mathbf{b}_{\text{MPG}}\)
  • \(\mathbf{b}_{\text{MPG}}\) 不被门控,所以低置信度下仍在起作用 —— 学到的是「不确定情境下的鲁棒默认修正」。

相对 DiG-Flow 的改进(方差分析):DiG-Flow 用 output gating \(\tilde H = H+\lambda g\mathcal{R}(H)\),gate 抖动时会同时缩放投影项和 bias,方差正比于 \(\|\mathbf{W}\mathcal{E}_{\text{obs}}(H)+\mathbf{b}\|_2^2\);MPG 把 gate 放在投影之前,只缩放投影项,方差正比于 \(\|\mathbf{W}\mathcal{E}_{\text{obs}}(H)\|_2^2\) —— 更小,轨迹更平滑。

gate 的计算用 sliced Wasserstein distance:

\[D(\mu_{\hat H},\mu_{\hat Z})\approx\frac{1}{M}\sum_{m=1}^{M}\left\|\text{sort}(\theta_m^\top\hat H)-\text{sort}(\theta_m^\top\hat Z)\right\|_2^2,\qquad g=\exp(-D/\tau)\in(0,1]\]

其中 \(\hat Z\) 来自零噪声级编码的 action token embedding 均值池化 \(\bar Z\),刻画「训练分布下合法动作嵌入的流形」。gate 上加 stop-gradient,防止模型学会操纵 \(g\) 而非改善特征质量。

3.5 Universal Async Chunking (UAC)

问题:模型算下一个 chunk 时机器人还在执行已提交的轨迹。仿真里可忽略,真机上推理延迟直接造成控制不连续。

RTC 的局限:训练时模拟延迟(前缀给干净 timestep \(t=1\),后缀给随机噪声 timestep \(t<1\),loss 只算后缀),但只为单一平台实例化

UAC 让延迟 embodiment-aware:对控制周期 \(\Delta t^{(e)}\)、推理延迟预算 \(L^{(e)}\) 的本体,有效延迟步数 \(\lceil L^{(e)}/\Delta t^{(e)}\rceil\)。采样

\[d\sim\pi^{(e)}(d),\quad d\in\{0,\dots,d_{\max}^{(e)}-1\},\qquad t_i=\mathbb{1}[i<d]+\mathbb{1}[i\ge d]\cdot t_{\text{base}}\]
\[\mathcal{L}_{\text{UAC}}=\sum_{i\ge d}\|\hat v_i - v_i^*\|_2^2\]

\(\pi^{(e)}\)\(d_{\max}^{(e)}\) 按每个本体的控制频率与预期延迟单独配置,与 ESA 联合训练,让单个 checkpoint 适配各异的运行时特性,配合双线程 buffer 做异步部署。

3.6 UniHand-2.0

UniHand-2.0

成分 规模
Egocentric 人类视频 16,000 小时
机器人操作数据 14,000 小时
通用视觉-语言理解数据 5,000 小时
总计 35,000+ 小时 / 1200 亿 token / 4 亿+ 样本 / 30 种本体

相对 UniHand(Being-H0)是 200× 扩容。加入 VL 语料是为了保住 VLM backbone 的高层推理、规划与指令跟随能力(防止 VLA 训练把 VLM 知识洗掉 —— 与 π 系列 Knowledge Insulation 同一动机,但手段是数据混合而非 stop-gradient)。

另外自研了 UniCraftor 人本数据采集系统,集成深度信息、关键帧事件、精确相机外参(这些在现有 benchmark 里常缺失),模块化设计以支持灵活视角和未来的触觉信息,已采集 200+ 小时、43 个任务

3.7 统一序列建模

把所有异构监督铸成单一序列建模问题:人类演示、机器人轨迹、视觉-语言语料序列化成同一条多模态 token 流,vision/text 提供上下文接地,统一的 state/action token 承载物理交互信号。不同数据用不同 loss 作用在相关片段上:

  • 文本语料(VQA、motion description)→ 标准 next-token prediction over text
  • 人类 + 机器人语料 → unified space 里的 action 预测(人类供密集可迁移行为先验,机器人轨迹锚定高保真运动学控制)
  • 离散手部动作 → masked token prediction
  • 连续动作 → Rectified Flow

4. 结果对比

4.1 LIBERO(RGB-only,224×224,2B backbone)

Method L-Spatial L-Object L-Goal L-Long Average
OpenVLA 84.7 88.4 79.2 53.7 76.5
π₀ 98.0 96.8 94.4 88.4 94.4
GR00T-N1 94.4 97.6 93.0 90.6 93.9
π₀.₅ 98.8 98.2 98.0 92.4 96.9
OpenVLA-OFT 97.6 98.4 97.9 94.5 97.1
X-VLA 98.2 98.6 97.8 97.6 98.1
EO1 99.7 99.8 99.2 94.8 98.2
Being-H0.5 (generalist) 97.0 98.2 99.0 96.2 97.6
Being-H0.5 (specialist) 99.2 99.6 99.4 97.4 98.9

4.2 RoboCasa 24 任务(Human-50 few-shot,5 个 held-out 场景)

Modality Method Pick & Place Doors/Drawers Others Total Avg.
3D DP3 1.5 41.7 32.0 22.8
3D GWM 14.8 54.3 49.8 39.3
RGB 256 GR00T-N1 18.6 50.2 39.1 36.0
RGB 256 π₀.₅ 21.5 57.8 44.9 41.4
RGB 256 π₀ 14.0 53.1 58.5 42.4
RGB 224 Being-H0.5 (generalist) 40 73 52 53.3
RGB 224 Being-H0.5 (specialist) 36 71.7 57.6 53.9

最大增益在 Pick & Place(36–40% vs π₀.₅ 的 21.5%) —— 这项最吃空间推理和 grasp-transport-place 协调,作者归因为大规模人本预训练蒸馏出的可迁移空间先验,且在 RGB-only、更低分辨率下就达成。

generalist vs specialist 的对照很关键:单一 checkpoint 联合训练 LIBERO+RoboCasa(2× 步数),LIBERO 只掉 1.3pp、RoboCasa 几乎持平 —— 说明在 unified action interface 下两个 benchmark 之间没有严重负迁移

4.3 真机与涌现的零样本迁移

real-world bars

跨 5 个物理形态显著超过 π₀.₅。论文特别标注的发现:

单个 Being-H0.5 generalist checkpoint,在跨本体联合训练后,在目标机器人上没有任何数据的「任务—本体」组合上取得了非零成功率

作者称之为 embodiment-level zero-shot transfer 的涌现信号

5. 引申问题 / 讨论

5.1 做得好的地方

  1. 「人手作为 generalized embodiment」的映射设计是全系列最优雅的一步。不是给人类数据单开一个分支,而是把 MANO 腕部位姿直接塞进机器人 EEF 子空间、手指塞进 fine-manipulation 槽位 —— 人类数据在架构上没有任何特殊地位,它就是第 31 种本体。这让「人类数据是母语」从一句口号变成了可执行的表示决策。

  2. ESA 的槽位级共享比 per-robot head 有实质进步。「同一手臂配不同的手」这类本体自动共享手臂槽位的适配参数,共享粒度是组件级而非全有或全无。这个设计正面回应了他们对 GR00T 的批评,而不只是嘴上批评。

  3. 拒绝统计归一化的理由是有物理观点的。「1 弧度和 10 厘米携带内在物理含义」—— 在一个人人都无脑 normalize 到 [-1,1] 的领域里,这是一个需要论证的反主流决策,而且与 unified action space 的整体逻辑自洽(既然要跨本体共享物理语义,就不能让每个本体各自的统计量把尺度洗掉)。

  4. MPG 相对 DiG-Flow 的改进给了干净的方差论证,不是「我们加了个 trick」而是「gate 放在投影前 vs 后,方差差一个 \(\|\mathbf{b}\|^2\) 项」。gate 上的 stop-gradient 也考虑到了「模型可能学会操纵 gate 而非改善特征」这个退化解。

  5. UAC 把 RTC 从单平台推广到异构机队是真正的工程贡献。每个本体单独配 \(\pi^{(e)}\)\(d_{\max}^{(e)}\),让一个 checkpoint 能同时服务 50Hz 的人形和低频的桌面臂 —— 这是"一个模型管所有机器人"从 demo 走向产品必须解决的问题。

  6. generalist/specialist 双报告 + 2× 步数补偿是诚实的实验设计。很多论文只报 specialist 数字然后暗示模型是通用的。

5.2 做得不够好 / 值得质疑的地方

  1. 与自家 Rethink-VLA(2602.09722)的结论正面冲突,且论文完全没提。Rethink-VLA 比本文晚一个月、共享 4 位作者(Ye Wang、Sipeng Zheng、Hao Luo、Wanpeng Zhang),系统性地发现:朴素混合异构机器人数据会导致负迁移 —— OXE-only(D1)在 RoboCasa 上 54.7%,加入真机 EEF 数据(D2)掉到 48.8%,加了仿真和关节数据也只回收一点,最终比 D1 低近 5pp。而 Being-H0.5 的整个叙事是「35,000 小时、30 种本体、200× 扩容带来 SOTA」。 善意解读是:Rethink-VLA 恰恰是 Being-H0.5 三大组件(unified action space + MoF 路由 + ESA)的存在性理由 —— 正因为朴素池化会互相干扰,才需要结构化对齐和容量隔离。但这个论证本文一句都没写,也没有「有/无 unified action space 下数据 scaling 曲线」的对照实验。读者无法判断 53.9% 是来自 200× 数据还是来自这三个组件在对抗数据干扰。这是全文最大的归因漏洞。

  2. UniHand-2.0 的「35,000 小时」缺乏可核查的分解。16,000 小时人类视频里 EgoDex 占多少?14,000 小时机器人数据里 OXE 占多少、自采多少?30 种本体的数据量分布是极度长尾还是相对均衡?技术报告有 44 页却没给这张表,而这恰恰是判断「200× 扩容」含金量的关键。另外 UniHand-1.0 实际只用了 2.5M 子集训练,本文是否也只用了子集?没说。

  3. 消融严重不足,三个核心组件(MoF / MPG / UAC)的独立贡献没有干净拆分。论文有 abl_freeze_moeabl_freeze_expertexp_real_bars_mpg_uac 这些图,但 MoF 的 Top-K、专家数、foundation/specialized 层数分割点这些关键超参都没有 sweep。尤其 MoF 是论文标题级的贡献("Mixture-of-Flow"),却没有「MoF vs 单一 dense action expert 在同等激活参数下」的对照 —— 无法排除收益只是来自总参数量增加。

  4. 「涌现的 embodiment-level zero-shot」这个最抓眼球的发现被报告得太单薄。只说「非零成功率」,没给具体数字、没说是哪个任务—本体组合、没说 baseline 在同样设置下是不是也非零。在一个跨本体动作空间统一、且很多本体共享槽位的设计里,「未见本体上非零成功」有可能只是因为该本体的槽位子集已被其他本体覆盖 —— 这更像是槽位共享的直接推论而非涌现。用 "emergent" 这个词需要更强的证据。

  5. 架构上对 Being-H0 的路线倒戈没有被正面讨论。Being-H0 的核心卖点是「motion 作为第四种语言、共享 attention、纯自回归」;Being-H0.5 换成了 MoT 双专家 + Rectified Flow 连续动作头,等于承认前作的统一 token 路线在动作精度/推理效率上不够。这是好的自我修正,但论文只字未提「为什么放弃」,也没有「统一 token vs MoT 双专家」的对照实验。离散手部动作仍保留 masked token prediction,成了一个混合体,其必要性也没消融。

  6. backbone 从 InternVL3 换到 InternVL-3.5 是又一个未受控变量。作者自己在 §3.1 承认「VLM backbone 的选择是关键的,视觉特征显著决定下游 VLA 效果」,并说「打算在未来系统性 benchmark 其他 backbone」—— 也就是说,Being-H0.5 相对 Being-H0 的提升里有多少来自更好的 backbone,作者自己也不知道。

  7. RoboCasa 上「超过 3D 方法」的对比不完全公平。Being-H0.5 用 RGB-only 224×224 打败了用显式 3D 输入的 DP3/GWM,这个叙事很好听,但 DP3 是个小模型(非 VLM 初始化),GWM 也不是 VLA 量级。真正该比的是「同样 2B backbone + 3D 输入」,那才能说明 3D 模态是否冗余。

  8. 边缘部署(Orin-NX)只是一个论断,没有任何延迟/显存数字。MoF 的卖点之一是「总参数与激活参数解耦,故可上边缘硬件」,但全文没给 Orin-NX 上的实测 latency、显存占用、控制频率。对一个把 real-time infrastructure 列为四大贡献之一的技术报告,这是明显的缺口。

  9. LIBERO 98.9% 已接近饱和,区分度存疑。前几名(X-VLA 98.1、EO1 98.2、Being-H0.5 98.9)的差距在 500 trials 下大概率不显著,而且 LIBERO 本身被 BeTTER(他们自己的 2604.18000)证明存在「静态评测掩盖表征退化」的问题 —— 拿它当头号卖点与自家的批判性工作互相矛盾。

5.3 值得继续探讨的方向

  • 补上「unified action space 的数据 scaling 消融」 —— 在有/无统一动作空间两种设定下重跑 Rethink-VLA 的 D1→D4 累积混合协议。如果统一空间下 scaling 变单调,那就同时证明了 Being-H0.5 的价值和 Rethink-VLA 的诊断,这是这两篇论文合起来最该做却没做的实验。
  • 把 MoF 的路由决策可视化:不同本体/任务实际路由到哪些专家?是按本体聚类还是按技能聚类?如果是后者,说明真的学到了可迁移运动基元;如果是前者,MoF 就退化成了带软共享的 per-robot head。
  • 零样本本体迁移的严格化:设计 leave-one-embodiment-out 协议,报告完整数字与 baseline 对照,并区分「槽位已被覆盖」与「真正的形态泛化」。
  • MPG 的 gate 在真机上的时序行为\(g\) 在遮挡/光照突变时的实际轨迹是什么样?有没有出现过度保守(一直 fallback 到 prior offset 导致不动)的失败模式?
  • 人类数据在 unified action space 里的最优配比:16,000 小时人类 vs 14,000 小时机器人,这个 1.14:1 是调出来的还是凑巧?scaling 曲线在哪个比例翻转?
  • UniCraftor 采的 200 小时含深度和触觉扩展位 —— 这明显是在为 TTP(2607.01067)和 UniTacHand(2512.21233)的触觉线铺路,值得关注融合后的版本。

参考资源