安全动作空间里的端到端灵巧:Geometric Fabrics + RL¶
横纵分析法 · Papers 版 — 种子论文 8 篇(2018–2026)
Executive Summary¶
这条线要回答的问题不是「灵巧手能不能抓」,而是:高自由度臂手在真机上怎么既敢探索、又不把自己和零件撞坏。NVIDIA Seattle Robotics Lab 给出的答案,是把 Geometric Fabric 做成 RL 的安全动作空间,再把特权信息 teacher 蒸馏成可部署的视觉 student。
八篇种子论文其实是两条支流在 2024 年汇合。一条是 Nathan Ratliff / Karl Van Wyk 的几何控制理论:从 RMPflow(2018)到 Geometric Fabrics(2021),再到「fabric 可以直接当 RL 动作空间」(2024.05)。另一条是 Ankur Handa 一脉的 GPU 大规模域随机化:DeXtreme(2022)先把 in-hand 重定向做成可迁移的 RL 基础设施。汇合之后的完整系统是 DextrAH-G(深度图、23-DoF、真机 256 次尝试 87%),随后 DextrAH-RGB 去掉深度相机,2025 年那篇 end-to-end RL 把 RGB 成功率从 77% 拉到 93%,2026 年 8 月的 ADEPT 再把同一套语言推到视触觉插装,并第一次认真做预训练 / 后训练。
当前格局已经从「证明零样本能过 sim-to-real」进入「证明配方能复用」。还没被这条线真正打开的,是开源权重、跨实验室复现、以及把 fabric 从 NVIDIA 内部控制栈变成社区默认接口。我的判断:未来 1–2 年这条线会继续沿「观测更便宜、任务更长、本体更多」往前走,但扩散速度会被 checkpoint 不公开卡住——这不是猜测,是它自己在索引里承认的结构性事实。
在碰 RL 之前,先发明一种新物理¶
如果只看 DextrAH 的 demo,很容易把这条线读成「又一个 Isaac Gym + PPO + 蒸馏」的故事。那会漏掉它最特殊的一层:策略并不直接写关节扭矩。策略写的是一个已经被证明稳定、可组合、可调的反应式行为层。这一层有自己的思想史,比 GPU RL 还早四年。
经典力学装不下「行为」¶
机器人控制里有一条很老的路线:把任务写成势能,让系统沿能量下降的方向走。它漂亮,也窄。位置空间上的度量一旦定下来,几何就被锁死;想同时做「走向目标、躲开障碍、保持姿态、别超关节限位」,就把一堆势能硬加在一起,再靠调参祈祷不要振荡。
2018 年 11 月,Ching-An Cheng、Mustafa Mukadam、Byron Boots、Nathan Ratliff 等人在 WAFR 上发表 RMPflow(arXiv:1811.07049)。它的关键 insight 不是又一个避障控制器,而是:每个子任务都活在自己的非线性流形上,应该先在那个流形里写成 Riemannian Motion Policy,再用计算图按几何一致的方式拉回配置空间。 论文给出了稳定性的充分条件,并证明利用稀疏结构可以算得动高自由度机械臂。实验场景是穿过杂乱空间——这正是后来臂手抓取必须先活下来的那个问题。
RMPflow 打开了一扇门,也留下一个裂缝。RMP 为了表达力,放弃了经典力学对度量的限制;表达力上来了,理论稳定性却变脆。2021 年 9 月的 Geometric Fabrics(arXiv:2109.10443,RA-L / ICRA 2022)就是来补这道裂缝的。Van Wyk、Boots、Ratliff 把经典力学先推广到 Finsler 几何,再显式「弯曲」这套几何去塑造行为,同时把稳定性留住。论文自己的对照对象不是某个 RL baseline,而是他们已经工程化、硬化过的 RMP 实现——fabric 在真机上胜过了自家上一代控制器。
这一步的意义要放到后面才看得清。2021 年的 fabric 还是一个控制器设计工具。它还没有变成 RL 的动作空间。但它已经具备三条后来被 RL 吃干抹尽的性质:可组合(多个行为可以加)、可调(设计者能改几何而不改稳定性证明)、天然稳定(策略输出被夹在一个不会自己发散的二阶系统里)。
OpenAI 已经证明过「灵巧能过 sim-to-real」,但那套东西太贵¶
和理论线平行,2018–2019 年 OpenAI 的 Dactyl / Rubik's cube 已经用域随机化把 in-hand 操作迁到真机。那是这条研究问题的存在性证明。它同时也是一个反面教材:Shadow Hand、运动捕捉、巨大的计算账单、难以复现。社区因此长期把「灵巧手 sim-to-real」理解成只有少数实验室玩得起的 circus trick。
2022 年 10 月的 DeXtreme(arXiv:2210.13702,ICRA 2023)要做的,就是把这套戏法从「贵」变成「可复制的基础设施」。Handa、Allshire、Van Wyk、Fox、State 用 Isaac Gym 在 GPU 上大规模域随机化,硬件换成更常见的 Allegro Hand,视觉位姿估计自己训,不再依赖 mocap。论文最硬的一句是:视觉策略显著超过文献里同任务的视觉策略,并且能跟「用 mocap 喂特权状态」的策略打平。项目页 dextreme.org 把代码公开了。
DeXtreme 还没有把 fabric 当作动作空间。它立住的是另一半:GPU 并行仿真、自适应域随机化(ADR)、视觉估计、以及「特权 teacher → 可部署 student」这套后来整条线都在说的工程语言。没有 DeXtreme,后面的 DextrAH 只是一个更漂亮的控制器;没有 fabric,DeXtreme 后面的臂手系统会继续活在「策略输出稍猛一点就撞限位」的恐惧里。
2024 年 5 月:两半拼上¶
Geometric Fabrics: a Safe Guiding Medium for Policy Learning(arXiv:2405.02250)是整条线最被低估的一篇。它几乎没有新的硬件 demo,却把一个设计选择说成了定理式的主张:fabric 不该只当底层控制器,它应该就是 RL 的动作空间。 策略输出被解释成对 fabric 的引导,而不是对关节的直接命令。训练效率来自动作空间已经被「削」成安全、反应式、带几何偏置的流形;真机安全来自同一套二阶系统在仿真和实物上用同一套方程。
两个月后,DextrAH-G(arXiv:2407.02274,CoRL 2024)把这个主张做成第一代完整系统。23 个电机的臂手,深度图进、动作出,全程仿真训练,零样本上真机。论文报告的主数字不是某个仿真 benchmark,而是一个接近产线的连续作业:超过 30 种物体,抓起来运到旁边的箱子。八轮实验里,连续成功次数均值 6.56 ± 2.41,周期 10.66 ± 0.84 秒(约 5.63 picks/min),256 次尝试成功率 87%。作者拿 Boothroyd-Dewhurst 表估了一个人类参照:约 16.53 PPM。机器大约是人的三分之一速度,但已经不是实验室里「抓一下停一下」的那种 demo。
DextrAH-G 的工程细节值得单独停一下,因为后面三年基本在换零件、不换骨架。Teacher 是特权状态上的 PPO,动作不是关节增量,而是对 fabric 的引导量;fabric 再往下接机器人。Student 用 DAgger 模仿 teacher 的动作分布,输入是深度图加本体感觉,输出仍落在同一个 fabric 接口上——这保证仿真和真机的低层控制器是同一套方程,而不是「仿真里 PD、真机上另一套阻抗」。物体位姿在 teacher 侧是特权,在 student 侧被一个辅助的位置预测头兜着,状态机用这个估计在「抓」和「运」之间切换。256 次尝试、30+ 物体的协议,比单物体 20 trial 的实验室报告更接近产线;但 87% 仍然把「抓起来放到箱子」算成功,不包括码放朝向、不包括下一工位插入。人类 16.53 PPM 的对照来自手册估算,不是同台实测,只能当数量级。
到这里,这条线的默认配方定型了:
深度相机是下一道该拆的墙¶
DextrAH-G 仍然吃深度图。深度相机贵、噪、怕太阳、产线上不一定有。2024 年 12 月的 DextrAH-RGB(arXiv:2412.01791,标 ICRA 2026)把输入换成纯双目 RGB。做法在概念上很朴素:teacher 还是特权状态 + fabric;student 改吃立体 RGB;蒸馏严格留在仿真里,靠照片级 tiled rendering 把外观域随机化做满。作者自称这是「复杂、动态、接触密集任务上,端到端 RGB 策略首次稳健 sim-to-real」。它和 DextrAH-G 的对比很能说明问题:同一套动作空间、同一套蒸馏,换的只是观测模态——所以后来 2025 年那篇 end-to-end RL 才能把「77% / 87% / 93%」放在同一张表里。
蒸馏有一条观测缝,端到端 RL 是在补它¶
标准配方的隐患,2025 年 9 月那篇 End-to-end RL Improves Dexterous Grasping Policies(arXiv:2509.16434)写得很直:state teacher 看见的是物体位姿和接触力,RGB student 看不见。蒸馏时这条 observability gap 会被学生用捷径补上,真机上就裂开。他们做了两件事。
第一件是工程。现有仿真器的多卡扩展是 data parallelism,视觉 RL 的 replay 太吃显存,PPO 的 batch 上不去。他们把仿真器和 PPO(含经验缓冲)拆到不同 GPU 上:四卡节点里三卡跑仿真、一卡跑 PPO,同等卡数下环境数翻倍。这不是算法贡献,但是视觉端到端 RL 能训起来的前提。
第二件是训练图。先把深度策略用 RL 训出来,再蒸到立体 RGB。深度和 RGB 都是像素,观测缝比「状态 → RGB」窄得多。真机对照表写得很干净:
| 方法 | Teacher | 真机成功率 |
|---|---|---|
| DextrAH-G | 状态 | 87% |
| DextrAH-RGB | 状态 | 77% |
| 本文 | 深度 | 87% |
| 本文 + 分卡仿真 | 深度 | 93% |
索引里写的「77% → 93%」指的就是这张表,不是 DextrAH-RGB 自己把数字刷上去了。社区共识会把它读成「端到端更好」;我的读法更窄:在这条特定的臂手抓取设定里,缩小 teacher/student 的观测缝,比继续加渲染随机化更值钱。分卡仿真把 batch 做大,是让深度 RL 先训得动的工程前提,不是独立的智能贡献。
ADEPT:第一次承认「每个下游任务从零训」是浪费¶
2026 年 8 月 19 日挂上 arXiv 的 ADEPT(arXiv:2608.19182)把问题从抓取换成了长程:抓起来、手里转、插进去。FMB 的 peg insertion 原本是给夹爪设计的,夹爪需要夹具和外部分解;ADEPT 用多指手一次做完,作者报告单次 5–10 秒,对照夹爪流水线的 20–70 秒(2×–14×)。两个本体:23-DoF 的 Kuka iiwa7 + Allegro(双 RGB),29-DoF 的 Flexiv-Sharpa(双 RGB + 五个指尖视觉触觉)。
真正新的不是「又能插了」,而是训练图从「一任务一训」变成「预训练 + 后训练」。预训练任务是通用的 object reposing:16 种随机尺度的几何体,做完 reach–grasp–lift–reorient–transport–repose。预训练策略对下游任务的「搬到孔上方」这一段可以零样本(ADR 35 以前成功率仍高于 50%),但一碰到孔口接触就掉到 0%。直接 PPO 微调会在很少的 update 里把预训练行为毁光——论文把原因写死了:奖励变了、观测多了新通道、critic 还在用旧价值、advantage 一歪,策略就被推离预训练分布。
ADEPT 的后训练配方因此不是「加一个 KL」这么简单:先 BC 蒸馏把 actor 接到新观测空间,再冻住 actor 给 critic 热身,最后用很小的 actor 学习率做保守 PPO。控制层也改了:以前 DextrAH 的 fabric 更偏任务空间引导,ADEPT 改成关节空间 Geometric Fabric,策略输出 [-1, 1]^nq 的关节相对增量,让 23 / 29 个自由度都被安全地用满。触觉侧用 TacMap 式的穿透深度图 + 二值接触图,再按 SaTA 的方式用指尖位置做 FiLM 锚定。
ADEPT 的预训练泛化表是它最有说服力的内部证据:只在 16 个 primitive 上训过的 teacher,对 FMB peg 和 VisDex 物体的 reposing 成功率不低于 in-distribution。说明 reposing 先验学到的是「手怎么在空间里安置一个刚体」,不是「记住这 16 个形状」。零样本插装曲线同样诚实:搬到孔上方(ADR 35)仍高于 50%,一接触孔口(ADR 50)掉到 0%。后训练必须从接触这一刻重新学。盘子任务则证明后训练不只是精修:预训练的抓取模式对盘子全部失败,但「已经伸到盘子附近、做出像样的接触尝试」足够当探索先验,下游 RL 能从这里长出新抓法。作者把自然抓取的出现归因于预训练把策略初始化进了「自然抓取」那块参数区域,而不是插入奖励本身——从零训的 PPO 会收敛到能插但难看的抓法,而且跨 seed 方差大。
还没被充分检验的,是这篇 2026 年 8 月 19 日的预印本最容易被营销的两句:「human-level speed」和「first demonstration of pick-reorient-insert from raw perception」。速度对照是 FMB 夹爪流水线的 20–70 秒对 5–10 秒,夹具和外部分解是主要慢因,不是人类手速。First demonstration 取决于你把 DemoStart、ManipGen、以及各种「估计位姿再插」算不算同一句话。ADEPT 自己的 related work 把差异写在 raw perception、无 pose tracker 上,这个差异是真的;把它说成灵巧插装的第一次,过满。
到 ADEPT,这条线完成了三次升级:控制器从 RMP 变成 fabric,再变成 RL 动作空间,再变成关节空间动作空间;观测从特权状态变成深度、RGB、视触觉;任务从 in-hand 重定向变成抓取,再变成抓–转–插。三次升级共用一个没变的骨架:仿真里用特权信息把难探索做掉,再蒸馏成真机读得懂的传感器。
2018 RMPflow 几何组合 + 稳定性
|
2021 Geometric Fabrics Finsler + 弯曲 = 可塑造且稳定
| \
2022 DeXtreme \ GPU RL / ADR / 视觉估计
| \
2024.05 fabric = RL 动作空间 两条汇合
|
2024.07 DextrAH-G 23-DoF 深度,连续作业 87%
2024.12 DextrAH-RGB 去掉深度相机
2025.09 e2e RL 深度 teacher,77% → 93%
2026.08 ADEPT 预训/后训 + 关节 fabric + 视触觉插装
同一套骨架上,其实在选五件事¶
把八篇种子摊开,真正正交的设计轴没有那么多。社区现在还在争的,是下面五件。
策略该写在哪一层:扭矩、任务空间,还是 fabric¶
一端是「策略直接出关节目标 / 扭矩」。探索空间最大,真机最容易把自己折了,奖励塑形也最痛苦。另一端是「策略只出高层目标,底层是经典阻抗或运动规划」——安全,但把灵巧手最有价值的协同自由度藏起来了。
Fabric 站在中间,而且是一种带理论承诺的中间。它的前提假设是:你能把安全约束、避碰、限位、速度界写成 fabric 里的几何项,并且这些项在仿真和真机上足够同构。这个假设一旦不成立——比如真机关节摩擦、腱驱动迟滞、未建模的线缆干涉——fabric 仍然稳定,只是稳定在错误的行为上。DextrAH 系列选择相信这个同构,并用域随机化去覆盖残余差距。ADEPT 把 fabric 从任务空间推进到关节空间,等于承认:要做插装这种需要「把每一个关节都用上」的事,任务空间引导会变成瓶颈。
和这条轴耦合的,是探索效率。动作空间被削过之后,PPO 的样本用在「怎么抓」而不是「怎么不爆炸」。这是这条线相对 OpenAI Dactyl、相对直接关节 RL 的真正优势。反过来说,如果下游任务需要一种 fabric 设计者没写进去的接触模式,策略会在一个过于礼貌的流形里转圈。ADEPT 的盘子任务提供了一个温和的反证:预训练的抓取模式对盘子全部零样本失败,后训练必须从「已经伸到盘子附近」的先验里重新发现抓法——fabric 没有阻止发现,但也没有帮忙。
Teacher 看见什么,student 才能稳¶
一端是特权状态 teacher(物体位姿、接触力、完整本体感觉),student 吃传感器。这是 DeXtreme / DextrAH-G / DextrAH-RGB / ADEPT 的默认。另一端是视觉端到端 RL,teacher 和 student 看见同类像素。2025 年那篇论文站在第二端,并且用真机 77% vs 93% 给出了目前这条线上最干净的对照。
两端的前提不一样。特权 teacher 假设你在仿真里能拿到准位姿和接触;对刚体抓取这大致成立,对 deformable、对液体、对「触觉是任务本身」这件事就不成立。像素 teacher 假设你渲染得够真、随机化得够狠,而且 batch 大到 PPO 能训视觉。分卡仿真是在买第二个假设。
用户和部署侧的偏好很清楚:产线不要 mocap,最好连深度相机都不要。所以产品形态会把 student 推向 RGB 或 RGB + 触觉。开发者侧则仍然需要特权 teacher,因为高维臂手从像素直接探索,在 2026 年也还没有变成默认能训动的事——ADEPT 自己的 student 仍然是蒸馏出来的,不是从像素 RL 训出来的。
一任务一训,还是先训一个「手会做事」的先验¶
DeXtreme 到 DextrAH-RGB 都是一任务一训。ADEPT 是这条线上第一个把 LLM 式的 pretrain / post-train 语言说完整的。它的证据目前还薄:预训练只在 16 种 primitive 上,每个本体单独预训,并不是一个跨本体基础模型。但诊断很硬——朴素微调把零样本能力打到 0%,这不是「微调超参没调好」,是 critic 错位引发的结构性崩溃。
我的判断:这个轴会变成下一阶段的主轴。抓取已经接近「训一次、搬一类物体」;插装、工具使用、多步骤装配会逼所有玩家表态——是继续为每个 NIST 零件烧一张卡,还是养一个会 repose 的先验再特化。Play2Perfect、SimToolReal、DemoStart 这些同期工作选了不同的先验(play、procedural primitive、示范),但它们部署时往往还在吃估计位姿。ADEPT 的差异是 student 吃原始 RGB / 触觉。这是它和夹爪装配那条 Factory 线开始重叠的地方:装配线用技能库(SRSA)解决「新零件从哪来」,灵巧手线用预训练解决「新手势从哪来」。
观测模态:深度、RGB、触觉,谁在付 sim-to-real 的账¶
深度的好处是几何直接,坏处是传感器本身就是域。RGB 的好处是相机到处都是,坏处是外观域必须用渲染去填。触觉的好处是接触这件事只有触觉看得见,坏处是仿真接触信号过 sim-to-real 的名声一直很差。
这条线的移动方向非常单向:能不用深度就不用,能加上触觉就加上,而且触觉被表示成和仿真共享的几何量(穿透深度、接触图),而不是仿真器原生的力。这是在抄 Factory 线 FORGE 的力阈值思路——把难仿真的物理量,改写成两边都能计算的几何代理。
还没人站的位置:纯触觉、无视觉的灵巧操作,以及「触觉作为 posterior、视觉作为 prior」那种 Being-H0.7 式的训练时特权。ADEPT 把触觉留给了 student,teacher 仍然更偏状态。这是一个空白。
开源到哪一层:代码、配方、还是能跑起来的权重¶
索引自己写了判决:「灵巧手那条线普遍只放代码不放 checkpoint,这也是它在社区里扩散慢的一个直接原因。」这不是风格问题,是方法问题。没有权重,别人无法验证 87% 和 93% 是不是绑在某一套未公开的渲染随机化、某一版 fabric 超参、某一台相机标定上。Factory 线至少把零件资产和部分环境放进了 Isaac Lab;抓取线把 GraspNet、ACRONYM、Contact-GraspNet 做成了公共底座。灵巧手线目前更像内部系统论文串。
这会反过来塑造路线选择。一个实验室如果复现不了 DextrAH,就更可能去复现 GraspNet 或 Factory,然后在自己的硬件上重造一遍「安全动作空间」。fabric 的理论是公开的,实现细节和调参传统是隐性资产。
和另外两条线比,用户口碑几乎不存在——没有足够多的外部用户。开发者能引用的是公式和 demo 视频,不能引用「我在自己的 Allegro 上复现了 87%」。这让 DextrAH 在引用图谱里像系统论文,在方法图谱里像还没交付的基础设施。我的 take:权重不公开不完全是商业保守,也是诚实——这些策略绑在特定的相机外参、特定的 fabric 超参、特定的渲染随机化范围上,放出一个 checkpoint 而不放整条随机化配置,复现者仍会失败,作者会收到一堆 issue。但长期不放,社区就会用「做不到」而不是「没公开」来解释扩散慢。
设计空间地图¶
| 工作 | 动作接口 | Teacher 观测 | Student 观测 | 训练图 | 任务 | 开源权重 |
|---|---|---|---|---|---|---|
| RMPflow / Fabrics 理论 | 几何控制,无 RL | — | — | — | 反应式运动 | 代码有 |
| DeXtreme | 关节 / 常规控制 | 特权 + 视觉估计 | 视觉 | RL + 估计器 | in-hand 重定向 | 代码有 |
| fabric as action space | fabric 引导 | 特权 | —(论证文) | RL | 通用 | 预印本 |
| DextrAH-G | fabric | 特权 | 深度 + 本体 | RL → 蒸馏 | 臂手抓取 + 搬运 | 代码有,权重基本无 |
| DextrAH-RGB | fabric | 特权 | 双目 RGB | RL → 蒸馏 | 同上,去深度 | 代码有 |
| e2e RL (2025.09) | fabric | 深度(RL) | 双目 RGB | 深度 RL → RGB 蒸馏 | 臂手抓取 | 预印本 |
| ADEPT | 关节空间 fabric | 特权 | RGB / RGB+触觉 | 预训 → 后训 → 蒸馏 | 抓–转–插 | 预印本,2026-08 |
玩家聚类很明显:Ratliff / Van Wyk 一直站在「动作接口」这一列,Handa / Allshire / Singh 一直站在「怎么把视觉 RL 做大」这一列,Fox 在早期(DeXtreme)出现、后期装配线更常见。空白格子是「像素端到端 RL + 关节 fabric + 开源权重」——理论组合存在,还没有一篇种子论文把它填上。
这条线已经证明了什么,下一拳会打向哪里¶
成熟度上,它已经走过 early exploration,进入 rapid convergence:2024 年之后的四篇论文不再争论「要不要 fabric」,只争论观测、训练图和任务范围。还没有进入 mature optimization——真机数字仍然来自同一间实验室、同一套未完全公开的栈。
最重要的未解决问题有三个,一个偏 fundamental,两个偏 engineering。
Fundamental 的那个:fabric 削过的动作空间,会不会把「必须用上未建模接触模式」的任务永久关在门外?盘子任务是一个软信号。工具使用、布料、打开未知机构,会是硬信号。如果后训练总能从预训练先验里长出新模式,这个担忧就降级为工程;如果不能,fabric 就从优势变成天花板。
Engineering 的两个:权重不公开导致的复现危机;以及「每个本体单独预训练」还不是 foundation model。ADEPT 自己写了「each task and embodiment is trained independently」。23-DoF 和 29-DoF 之间没有共享表征。这和 Being-H0.5 的 unified action space、和 Factory 线 AutoMate 的 generalist 都形成对照。
接下来 1–2 年我看好三件事,置信度从高到低:
- RGB + 廉价相机成为默认部署观测(高)。深度相机在这条线的叙事里已经是要被拆掉的墙,e2e RL 论文把 RGB 做到 93%,没有回头的商业理由。
- 预训练 / 后训练会从 ADEPT 的一篇预印本变成默认配方(中)。诊断太干净了,不会被忽略;但先验任务会不会停在 16 个 primitive 上,还是长成跨物体、跨本体的 play,仍不确定。
- 视触觉插装会倒逼仿真接触表示的标准化(中)。ADEPT 选了 TacMap + FiLM,这是在赌「几何代理比力信号好迁移」。如果这个赌赢了,灵巧手线和 Factory 的 FORGE / TacSL 会在表示层汇合;如果输了,触觉会继续停在 demo 级。
和 Factory 线比,这条线更晚承认「一任务一训」的浪费,更早坚持零样本 student。Factory 2026 年用 SPARR 把最后 10–20 个点交给真机 residual;灵巧手线到 ADEPT 仍把 student 零样本当贡献。两个判断可以同时对:抓取和粗插装的视觉域能被渲染随机化盖住,亚毫米装配的接触残差盖不住。ADEPT 做 FMB peg 而不是 Factory 的螺纹,正好停在这个分界附近。若下一步去卡扣和螺纹,我预期他们会被迫写下自己的 SPARR——或者用触觉把残差读出来,而不是在真机上再训一层。
对八篇种子的整体评价:它们把「安全动作空间 × GPU RL × 蒸馏」这条配方从理论推到了长程视触觉任务,覆盖了控制、观测、训练图三张主轴。完全没碰到的,是数据开源、跨机构复现、以及和 VLA / 世界模型路线的接口——π 系列、LingBot-VA、Being-H 都不会把动作写进 fabric,两边目前还是平行宇宙。我倾向于认为这不是永远的平行:谁先把 fabric 做成一个可被大模型调用的低层技能接口,谁就吃到两条生态。
那套共用的工程语言,在这里分别指什么¶
索引把三条线收在同一页,是因为它们说同三种话:GPU 并行仿真、域随机化、特权 teacher 蒸馏。落在灵巧手线上,三个词的意思和其他两条并不一样。
GPU 并行仿真在这里首先是 Isaac Gym 把几千只手同时掉下来,其次才是 2025 年那篇把仿真器和 PPO 拆到不同卡上。没有第一层,DeXtreme 不存在;没有第二层,深度端到端 RL 的 batch 上不去。装配线的 GPU 仿真首先是接触求解器,抓取线的「大规模」首先是离线合成数据集,甚至不必在线并行。同一句「GPU」,一个指在线 RL 吞吐量,一个指接触物理,一个指标签工厂。
域随机化在这里是 ADR:成功率涨了,再把重力、物体尺度、摩擦、视觉噪声往上加。这是课程,不是一次性把纹理随机化到 Tobin 2017 那种贴纸风。抓取检测用深度之后,很多方法宣称「不用随机化也能过」;装配线 IndustReal 甚至明确写过他们避免动力学随机化,怕把插入这种高精度任务的物理随机坏。灵巧手线是三条里最依赖「把真实世界盖进训练分布」的,也因此最依赖渲染器和随机化范围这些不可见超参。
特权蒸馏在这里是系统的主路径,不是可选头。Teacher 必须看见物体位姿和接触,student 必须只看见相机。2025 年论文证明这条路径有观测缝;ADEPT 仍然走它,只是把 teacher 的能力用预训练存起来。装配线的蒸馏出现得更晚、更弱(AutoMate 的 generalist 蒸馏),抓取线几乎不蒸馏——检测器直接监督。谁在用蒸馏,谁就是在训闭环策略而不是开环检测。
把三句话翻译成这条线的方言:并行的是手,随机化的是物理和像素,蒸馏的是从上帝视角到相机。 读 DextrAH 的人如果只记住 87%,会漏掉这三句方言里每一句都绑着一个还没公开的实现细节。
Further Reading¶
种子八篇之外,建议按这个顺序补:
- OpenAI Dactyl / Rubik's cube(2018–2019)—— 灵巧手 sim-to-real 的存在性证明,也是 DeXtreme 要对着打的「太贵」基线。
- Isaac Gym(Makoviychuk et al., 2021)—— 没有 GPU 仿真器,后面六篇都不会以现在的形态出现。
- Ratliff 等,Riemannian Motion Policies 原文—— RMPflow 的直接前身,读它才能看懂 fabric 到底推广了什么。
- Hora / visuo-motor in-hand(后续 in-hand 工作)—— 和 DeXtreme 同任务族,用来校准「视觉策略打平 mocap」这句话的难度。
- DemoStart(2024)—— 另一条「抓–转–插」RL 线,用来对照 ADEPT 为什么强调 raw perception。
- Play2Perfect(与 ADEPT 同期)—— 同样做预训练,但部署吃位姿;是 ADEPT 叙事里最该对打的一张牌。
- SimToolReal—— procedural primitive 先验,说明「通用操作先验」不必长成 reposing。
- TacMap / SaTA / HydroShear—— ADEPT 触觉表示的三篇直接前驱。
- TacSL(arXiv:2408.06506)—— 触觉仿真库,索引明确说它服务装配线、不是主线,但灵巧手线迟早要碰。
- OmniReset—— 用重置分布逼出涌现灵巧,ADEPT 用策略级先验做同一件事。
- ManipGen—— 局部仿真策略 + 运动规划拼长程,是「不把一切塞进一个 fabric 策略」的对照。
- LeapHand / 低成本灵巧手硬件工作—— 这条线的扩散不仅被权重卡住,也被「谁有 23-DoF 臂手」卡住。
- DAgger(Ross et al., 2011)—— student 训练的算法祖先,DextrAH-RGB / ADEPT 都在用。
- PPO(Schulman et al., 2017)—— 整条线的默认 RL;视觉 batch 问题本质上是 PPO 对 on-policy batch 的依赖。
- Factory / IndustReal(见装配线报告)—— 同一栋楼里的另一条谱系,读完才能判断 ADEPT 的插装和夹爪装配是不是同一问题的两个分辨率。
收尾¶
把 Geometric Fabrics 理解成「又一个控制器」会看轻它;把它理解成「RL 能成功的原因」又会看重它。更准确的说法是:这条线找到了一个让高维探索和真机安全同时成立的接口,然后用四年把观测和任务往这个接口上堆。接口选对了,堆东西就很快;接口一旦碰到它削不掉的接触模式,整栋楼都要改地基。ADEPT 已经开始在地基上开窗(关节空间、预训练、触觉)。下一步是看这扇窗通向复现和开源,还是只通向下一篇内部系统论文。