真实世界只是训练分布里的一个样本:夹爪抓取的合成数据与域随机化¶
横纵分析法 · Papers 版 — 种子论文 13 篇(2017–2024)
索引原文写「14 篇」。按首次公开时间列出的抓取 / 方法论种子是 13 篇;第 14 的位置更像是把「域随机化」同时算成方法论源头和抓取论文,或把对照工作 QT-Opt / VPG 之一算了进去。下文按 13 篇种子展开,对照工作单独写。
Executive Summary¶
夹爪抓取这条线要解决的问题,比另外两条都更「视觉」:给定一张深度图或点云,立刻给出能抓住未见物体的 6-DoF 夹爪位姿。 它不是端到端 RL 的故事,而是合成数据、解析式抓取度量、以及「仿真图像怎么变成真机图像」的故事。2017 年 3 月,两篇几乎同时出现的论文把空间打开:Tobin 等人的 Domain Randomization 说,随机化纹理和光照,直到真实世界看起来只是另一个样本;Mahler 等人的 Dex-Net 2.0 说,670 万条合成深度点云配解析鲁棒性度量,抓取学习可以整个搬进仿真。
之后七年裂成三支。一支把翻译器做在像素上(GraspGAN、RCAN);一支把抓取表示从平面 4-DoF 推到 6-DoF,再推到接触点、体素、隐式场(6-DOF GraspNet、VGN、Contact-GraspNet、GIGA、M2T2);一支反过来,用真机 RGB-D 海量标注建立评测协议(GraspNet-1Billion),再在这份协议上把时序和重心做进去(AnyGrasp),最后发现稠密监督本身才是训练开销(EconomicGrasp)。NVIDIA Seattle 是 6-DoF 仿真数据这一支的主场;上海交大卢策吾组是真机基准这一支的主场;Google / DeepMind 和牛津是域适应这一支的主场。
当前格局里,6-DoF 抓取检测已经是工程可用的模块(AnyGrasp 清箱 93.3%,约 900 MPPH),但主方法停在编译 SDK 或封闭权重,开源替代(Contact-GraspNet、GSNet、EconomicGrasp)在 GraspNet 协议上继续抠 AP。和另外两条线比,这条线最早成熟,也最早碰到自己的天花板:抓取位姿对了,并不等于后面的装配或灵巧操作对了。它给 Factory 和 DextrAH 提供过感知前端,自己却没有长成策略。
2017 年春天,两扇门同时打开¶
在此之前,抓取学习的默认方案是:在真机上采,或者在仿真里用看起来尽量像真的渲染。前者贵,后者一过摄像头就崩。2017 年 3 月的两篇论文分别拒绝了这两个默认。
随机化,而不是逼真¶
Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World(arXiv:1703.06907,IROS 2017;Tobin、Fong、Zaremba、Abbeel)的实验对象其实只是物体定位,抓取只是下游演示。但它把一句后来被用滥的话写进了标题级主张:随机化仿真里的纹理、光照、相机位姿,模型就会把真机图像当成训练分布的一次抽样。他们用非写实的随机纹理,把真机定位做到 1.5 cm,并能在杂乱里抓。这不是抓取网络论文,是整棵 sim-to-real 树的方法论根。Factory 线和灵巧手线后来用的 ADR、外观随机化、渲染随机化,都是这句话的子孙。
它关闭的假设是「仿真必须 photorealistic」。打开的假设是「分布覆盖比单一样本逼真更重要」。这个假设在低层几何任务上成立得很好,在需要读品牌、读文字、读透明物体的任务上后来反复被打脸——那正是域适应分支存在的理由。
解析度量,而不是真机成功标签¶
同一周的 Dex-Net 2.0(arXiv:1703.09312,RSS 2017;Mahler、Goldberg)走另一条路。670 万条合成点云,抓取质量不靠真机试抓,靠解析式鲁棒性度量(力封闭、对扰动的敏感度)。GQ-CNN 从深度图预测平面抓取(位置、角度、深度)的成功概率。ABB YuMi 上 1000+ trial:已知的 8 个对抗几何物体 93%,0.8 秒出方案,比先做物体配准再抓快 3 倍。代码和权重公开,这为后面整条开源抓取生态定了调。
Dex-Net 关闭的假设是「抓取标签必须来自物理成功」。打开的假设是「解析度量 + 大规模合成几何 ≈ 真机成功」。这个假设在刚性、不透明、桌面物体上极度好用;在柔性、透明、严重遮挡上会系统性偏乐观。GraspNet-1Billion 后来用真机图像 + 解析评估做了一个折中:图像是真的,标签仍然是算出来的。
2017 年 3 月因此不是一条线的起点,是一个问题空间被两把钥匙同时打开:一把开视觉域,一把开抓取标签。后面所有种子论文都是在选钥匙、换锁芯。
域适应:翻译器派的两年¶
随机化有一个浪费:模型容量花在「无视那些永远不会在真机出现的纹理」上。域适应的回答是,做一个翻译器,让仿真和真机在某个空间里重逢。
GraspGAN(arXiv:1709.07857,ICRA 2018;Bousmalis、Levine、Vanhoucke)把仿真图翻成真机风格。超过 25,000 次真机试抓。合成数据 + 域适应最多把达到同等性能所需的真机样本降 50 倍;只用未标注真机数据 + GraspGAN,性能接近用 939,777 条标注真机样本训出来的系统。这是「真机数据很贵,但可以少要」的量化起源。
RCAN(arXiv:1812.07252,CVPR 2019;James、Levine、Bousmalis)把翻译方向反过来:随机化仿真图和真机图都映到同一个规范仿真域,策略只在规范域上训。零真机数据时,闭环抓取 70%,几乎是纯域随机化的两倍;再加 5,000 次真机试抓微调到 91%,对标用 580,000 次真机抓取训出来的系统,真机数据少 99% 以上。
两篇翻译器论文还有一个被后来仿真 6-DoF 方法悄悄继承的设定:它们的下游是闭环策略,不是一次性检测。GraspGAN 和 RCAN 训的是从图像到动作的 agent,所以「过域」必须在控制回路里成立。6-DOF GraspNet 之后主线改成开环检测 + 运动规划,过域的压力立刻小了——检测错了可以再检一次,策略错了会把桌子扫了。这也能解释翻译器为什么退出抓取检测:问题被重新形式化成了「出一堆位姿」,不是「一直看、一直动」。灵巧手线 2024 年重新变成闭环策略,翻译器的精神以 tiled rendering 的形式回来,不是偶然。
RCAN 是这支的高潮,也是尾声。2019 年之后,像素翻译不再是抓取主线的核心论文。不是因为它错了,是因为 6-DoF 点云方法发现:深度 / 点云的域间隙比 RGB 小一个数量级,做几何比做外观翻译更划算。翻译器派的遗产进了灵巧手线的 tiled rendering 和 DextrAH-RGB,而不是继续留在夹爪抓取检测里。
从打分一张平面抓取,到一次前向出满桌 6-DoF¶
采样完整位姿,再迭代精修¶
6-DOF GraspNet(arXiv:1905.10520,ICCV 2019;Mousavian、Eppner、Fox)是 NVIDIA Seattle 抓取线的开门之作。VAE 在观测点云上采样 6-DoF 位姿,再由评价网络打分并迭代精修。纯仿真训练,真机 88%。它把问题从 Dex-Net 的「桌面 4-DoF 打分」升级成「物体周围的完整 SE(3)」。代价是流水线变长:采样、评价、精修、碰撞检查,闭环吃力。
ACRONYM(arXiv:2011.09584,ICRA 2021;同一作者三人组)是给这套方法的汽油。8,872 物体、262 类、1,770 万次仿真抓取,物理仿真出成功标签。他们用它重训两个 SOTA 抓取网络,性能相对原小数据集显著上升。数据比新网络更重要——这句话在 2020 年的抓取领域,是被实验撑住的,不是口号。ACRONYM 此后成为仿真 6-DoF 方法的公共训练底座,地位类似 OXE 之于 VLA。
把 6-DoF 锚回能看见的点¶
流水线太长的问题,2021 年被三篇论文从三个表示同时打。
VGN(arXiv:2101.01132,CoRL 2020;Breyer、Siegwart、Nieto)吃 TSDF 体素,3D 全卷积一次出整个工作空间的质量、方向、开口,约 10 ms,清杂乱 92%,不显式做碰撞检查。它把抓取检测变成稠密 3D 预测,第一次让闭环在算力上说得通。
Contact-GraspNet(arXiv:2103.14127,ICRA 2021;Sundermeyer、Mousavian、Triebel、Fox)把完整 6-DoF 降到「接触点上的 4-DoF」:点云里的点就是潜在接触,位姿和开口从这一点长出来。17M 仿真抓取训练,结构化杂乱里未见物体超过 90%,失败率相对前代 SOTA 减半。这是开源 6-DoF 里后来被用得最多的一个——因为它又快、又锚在观测上、又放了代码和权重。
GIGA(arXiv:2104.01542,RSS 2021;Jiang、Zhu)说抓取 affordance 和 3D 占据重建是同一件事:都要局部几何。隐式场共享特征做多任务,单视角遮挡被重建支路补上,相对 baseline 成功率 +10% 以上。它是这条线里最「表示学习」的一篇,也是后来 implicit grasping 的种子。
三篇 2021 年论文共同关闭的假设是「6-DoF 必须先采样再打分」。打开的是「一次前向、稠密、和观测对齐的抓取场」。闭环抓取从这里开始变成默认,而不是附录。
真机图像的反向路线¶
仿真派正把标签和表示做漂亮的时候,GraspNet-1Billion(预印本 arXiv:1912.13470,CVPR 2020;Fang、Wang、Gou、Lu)走了反向。网站口径:190 个杂乱场景、两台 RGB-D(Kinect Azure + RealSense D435)、97,280 张图、88 个物体、超过 11 亿条抓取。预印本摘要写的是 87,040 张、3.7 亿条——公开数据集在投稿后继续长大,引用时以 graspnet.net 的 97,280 / 1.1B 为准。标签不是人标 11 亿个位姿,是物体 6D 位姿标准之后,用解析力封闭自动长出稠密抓取。评测协议因此可以接受任何方法的输出,不必和某一种参数化对齐。
评测协议本身值得拆开。AP 不是真机试抓平均,是:对每个场景取 top-k 预测,用物体 mesh 和力封闭在一组摩擦系数 μ 上判定成功,再对 k 和 μ 取平均。它的好处是任何参数化都能投,不必和 Dex-Net 的 4-DoF 对齐;坏处是分数和「这个深度相机今天的噪声」无关——评测用的是数据集里的点云,不是你的相机。论文声称和真机实验对齐,AnyGrasp 后来用 93.3% 清箱给了一个真机锚点。但 Novel 物体 AP 长期停在 20 左右(EconomicGrasp RealSense Novel 25.48),说明协议对未见几何仍然很硬,也说明刷 Seen AP 和刷真机清箱可以不是同一件事。
这是抓取领域的 ImageNet 时刻。它改变的不是算法,是什么叫赢。此后开源方法如果不报 GraspNet AP,审稿人会追问。AnyGrasp 和 EconomicGrasp 都活在这套协议上。它也带来一个微妙的偏差:解析力封闭定义的「好抓取」,和真机上「抓起来还能做下一件事」不是同一分布。清箱成功率可以很高,功能抓取仍然差。
时序、重心、以及把开源收进 SDK¶
AnyGrasp(arXiv:2212.08333,T-RO 2023;Fang、Lu)是 GraspNet 组把自己的基准吃满之后的系统论文。稠密监督 + 真机感知 + 解析标签,加上重心感知和跨帧抓取对应,输出 7-DoF(含开口)且时序平滑的稠密抓取,声称对深度噪声稳健。清箱:300+ 未见物体,93.3%,对照人类受试者 93.9%;单臂约 900 MPPH;动态演示是抓水里的机器鱼。工程上它赢了。开源上它退了:放出的是编译 SDK,不是训练代码和可复现权重。索引把 CODE / WEIGHTS 划掉,这是整条抓取线最大的生态裂痕——基准是开的,最强系统是关的。
M2T2(arXiv:2311.00926,CoRL 2023;Yuan、Murali、Mousavian、Fox)是 NVIDIA 侧对「抓完要放」的回答。多任务 masked transformer,抓和放都变成接触区域分割:一个模型同时出抓取位姿和朝向感知的放置位姿。它没有去刷 GraspNet AP 竞赛,而是把抓取检测重新嵌回操作。这是种子里最接近 Factory 线的一篇:物体中心、接触区域、放置,已经是装配的前夜。但它停在 pick-and-place,没有进间隙配合。
稠密监督是成本,不是精度的朋友¶
EconomicGrasp(arXiv:2407.08366,ECCV 2024;Wu、Zheng)对着 AnyGrasp 以来的默认开刀:SOTA 之所以又慢又难收敛,是因为把所有稠密标签都喂进去,其中大量标签互相矛盾。他们做监督选择,留下低歧义的关键标签,再配 focal representation 只盯一个抓取。GraspNet 上平均约 +3 AP,训练时间约 1/4,显存约 1/8,存储约 1/30(索引写的 55 GB → 1.6 GB 与 1/30 合量级)。Kinect 上 Seen / Similar / Novel AP 为 62.59 / 51.73 / 19.54,RealSense 上 68.21 / 61.19 / 25.48。Novel 仍然很低——经济监督没有解决泛化,只解决了训练账单。
AnyGrasp 的 900 MPPH 和人类 93.9% 对照,是这条线最接近「产品指标」的两句话。MPPH 把检测、规划、运动、掉落全算进去,比 AP 诚实。人类对照在受控条件下,物体种类人类更熟,机器对「任意未见」更公平——作者自己写了这句。动态抓鱼是展示时序跟踪,不是主表。真正改变生态的是 SDK 策略:研究组可以在 GraspNet 上发论文,工厂可以直接买检测器,中间那层「可复现的最强开源」被抽空了。Contact-GraspNet 填过这个坑,但 2021 年的网络对 2023 年的 SDK 没有系统级对照。
到 2024 年,这条线的主问题已经从「有没有数据、6-DoF 能不能一次出」变成「标签要多密、开源还能不能跟上闭源 SDK」。没有下一篇种子把抓取检测重新定义成策略问题。空间被让给了 VLA、WAM 和另外两条 NVIDIA 线。
2017.03 DR 视觉域:随机化 > 逼真
2017.03 Dex-Net 2.0 标签域:解析度量 + 670 万合成
| \
2017–18 GraspGAN/RCAN \ 像素翻译(此后淡出抓取主线)
|
2019 6-DOF GraspNet SE(3) 采样 + 精修
2019 GraspNet-1Billion 真机基准(反向)
2020 ACRONYM 仿真 6-DoF 公共底座
2021 VGN / Contact-GraspNet / GIGA
一次前向的三种表示
2022 AnyGrasp 时序 + 重心,93.3%,SDK
2023 M2T2 抓和放统一成接触分割
2024 EconomicGrasp 稠密监督是瓶颈
三条支流,四次选择¶
和 Factory、Fabrics 不同,这条线从第一天就不是一个实验室。横向必须按问题怎么被形式化来分,不能按公司分。
标签从哪来:解析、仿真物理,还是真机试抓¶
Dex-Net / GraspNet / AnyGrasp / EconomicGrasp 站解析。ACRONYM / 6-DOF GraspNet / Contact-GraspNet 站仿真物理。GraspGAN / RCAN 的策略侧,以及对照 QT-Opt / VPG,站真机试抓。
解析最便宜、最密、最容易和评测协议对齐;它假设刚体、已知摩擦、力封闭 ≈ 成功。仿真物理更贵一点,能看到动态滑脱,但接触模型仍然是假的。真机试抓最真,贵到只有 Google 那种规模能玩 QT-Opt。
证据并不对称。Dex-Net 93%、Contact-GraspNet 90%、AnyGrasp 93.3% 都是在「抓起来算赢」的协议上。换成功能抓取(抓把手、抓工具工作端),解析标签的优势会缩小——M2T2 已经在用接触区域补朝向,等于承认力封闭不够。我的 take:对平行夹爪清箱,解析标签已经够用;对要交给 Factory 或 DextrAH 的下游,标签必须带任务。种子论文几乎没做这个迁移实验。
表示:平面、SE(3) 采样、接触点、体素、隐式场¶
Dex-Net 是平面 4-DoF。6-DOF GraspNet 是 SE(3) 采样。Contact-GraspNet 是接触点 4-DoF。VGN 是体素场。GIGA 是隐式场。AnyGrasp 是时序稠密 7-DoF。M2T2 是分割。
2021 年之后,接触点 / 稠密场赢了采样流水线。不是因为采样更差,是因为闭环延迟和工程复杂度。VGN 的 10 ms 和 Contact-GraspNet 的单次前向,把「先检测再规划」变成「每帧都能重想」。这和灵巧手线用 fabric 换安全、装配线用 PLAI 换稳态,是同一类工程直觉:把不稳定的开环环节收成高频闭环。
隐式场没有成为主流部署。GIGA 的 +10% 在论文设定里成立,社区复现和工业集成仍以点云 CNN / transformer 为主。EconomicGrasp 证明表示还可以再薄:与其预测所有抓取,不如预测一个对的。
过域:随机化、翻译,还是直接用深度¶
RGB 抓取必须过域,所以有 DR / GraspGAN / RCAN。深度 / 点云抓取往往号称「仿真直接零样本」,6-DOF GraspNet、Contact-GraspNet、VGN 都这么做。GraspNet-1Billion 更绝:训练数据直接是真机图像。
2019 年之后主线选了第三条和第四条,翻译器退出。这个选择有混淆因素:深度域间隙确实更小,但深度相机自己就是一个脆弱传感器——透明、黑、反光、太阳。AnyGrasp 花了篇幅讲深度噪声鲁棒,DextrAH-RGB 则选择放弃深度。夹爪抓取线至今没有一篇种子论文把「纯 RGB 6-DoF 检测」做成开源 SOTA。这是和灵巧手线 2024–2025 最大的分叉:一边在删深度,一边还把深度当默认。
开源协议 vs 闭源系统¶
GraspNet 协议是开的,AnyGrasp 系统是关的。Contact-GraspNet、ACRONYM、EconomicGrasp、VGN、GIGA 是开的。这个裂痕决定了学术引用和图谱:论文比 AP,产线买 SDK。EconomicGrasp +3 AP 赢的是开源对手;它有没有赢 SDK,表上读不出来。
和灵巧手线「有代码无权重」不同,抓取线的开源部分是真的能跑。扩散慢的不是配方,是最强配方被收进产品。这是成熟领域的典型形态,也是这条线被判「2024 年之后不再出种子」的原因之一:开源侧进入抠分,闭源侧进入销售。
对照:QT-Opt 和 VPG 为什么不算 sim-to-real¶
索引点名的 QT-Opt(CoRL 2018)和 VPG(IROS 2018)是真机自采 RL,没有仿真训练成分。它们证明:如果你有足够的真机试抓,可以不走合成数据。GraspGAN 把「足够」量化成了几十万到上百万。RCAN 把「足够」压到 5,000。QT-Opt 路线没有输,它只是贵。2026 年的 SPARR 从装配侧重新靠近它——真机学习又回来了,但必须站在仿真先验上。抓取线自己没有做这个回头。
设计空间地图¶
| 工作 | 标签 | 表示 | 过域方式 | 开源 | 真机 / 基准主数字 |
|---|---|---|---|---|---|
| Domain Randomization | 定位标签 | 检测框 | 随机化 RGB | 论文 | 1.5 cm |
| Dex-Net 2.0 | 解析度量 | 平面 4-DoF | 合成深度 | 代码+权重 | 93% / 8 物体 |
| GraspGAN | 真机 + 仿真 | RGB 策略 | 仿真→真机翻译 | — | 真机样本最多 ÷50 |
| RCAN | 仿真 | RGB 策略 | 双边→规范域 | — | 70% 零样本 / 91% +5k |
| 6-DOF GraspNet | 仿真 | SE(3) VAE | 深度零样本 | 代码+权重 | 88% |
| GraspNet-1Billion | 真机图 + 解析 | 稠密 6-DoF 协议 | 直接真机 | 数据+评测 | 97,280 图 / 1.1B |
| ACRONYM | 仿真物理 | 供下游训 | 深度 | 数据 | 8,872 物 / 17.7M |
| VGN | 仿真 | TSDF 体素场 | 深度 | 代码+权重 | 10 ms,清箱 92% |
| Contact-GraspNet | 仿真 17M | 接触点 4-DoF | 深度 | 代码+权重 | >90% |
| GIGA | 仿真 | 隐式场多任务 | 深度 | 代码+权重 | +10% vs baseline |
| AnyGrasp | 真机+解析 | 时序 7-DoF | 真机深度 | SDK | 93.3%,~900 MPPH |
| M2T2 | 仿真 / 操作数据 | 接触分割 | 点云 | 代码+权重 | 抓+放统一 |
| EconomicGrasp | GraspNet 稠密子集 | focal 单抓取 | 真机基准 | 代码+权重 | +3 AP,账单 ÷4–30 |
玩家聚类:NVIDIA Seattle(Mousavian / Eppner / Fox / Sundermeyer / Yuan)占据仿真 6-DoF 和 ACRONYM;SJTU(Fang / Lu)占据真机基准和 AnyGrasp;Google Brain(Bousmalis / Levine / James)占据翻译器,2019 年后撤离;Berkeley AUTOLab(Mahler / Goldberg)提供 2017 年的解析标签原教旨;ETH(Breyer)提供体素闭环;中山大学 iSEE(Wu / Zheng)在 2024 年做开源侧的成本修正。没有一个玩家同时占据「最强系统」和「最开协议」,这是这条线不同于 Factory、也不同于 DextrAH 的政治结构。
抓取检测已经够用,所以它不再是主问题¶
成熟度:mature optimization,局部已经商品化。AnyGrasp 的人类对照 93.3% vs 93.9% 是成熟标志;EconomicGrasp 开始抠训练账单是成熟标志;2019 年后翻译器退出、2024 年后没有新的种子问题定义,也是成熟标志。
还开着的问题反而都在边界外:
- 功能抓取 / 任务条件抓取。 抓「能插进孔的那个朝向」,不是抓「力封闭最高的那个」。M2T2 开了一条缝,没走完。Factory 和 ADEPT 都在自己的策略里重新学抓,说明它们不信任现成检测器的朝向。
- RGB-only 开源 6-DoF。 深度默认一天不改,透明物体和户外就一天是事故。
- 评测和下游错位。 GraspNet AP 和清箱 SR 可以同时很高,装配成功率仍然低。需要一个「抓了之后要做什么」的协议。
- 闭源 SOTA 对研究的虹吸。 新方法如果不能合法对比 AnyGrasp SDK,只能在开源子集里报 +3 AP,审稿和工业都越来越不在乎。
1–2 年轨迹:
- 作为模块,抓取检测会沉到系统论文的相关工作里,而不是标题里(高)。VLA、WAM、DextrAH、Factory 都已经这样用它,或干脆绕开它用端到端策略。
- EconomicGrasp 式的稀疏监督会被默认(中)。账单数字太具体,跟着 GraspNet 协议走的人没有理由继续存 55 GB 标签。
- 新的主问题会是「语言 / 功能条件的抓取」而不是「再高 2 个 AP」(中)。这需要新基准,GraspNet-1Billion 不会自然长出语言标注。
- 翻译器派会在 RGB 灵巧策略里复活,而不是在夹爪检测里复活(高)。DextrAH-RGB 已经在做这件事。
和另外两条线的接口,实际比引用图谱显示的更松。Factory / IndustReal 的感知是自己的 2D 位姿估计,不是 GraspNet 检测器。DextrAH 从像素直接出动作,把抓取检测整个绕开。M2T2 是种子里唯一认真把「放」和「抓」写成一个模型的,却既没有变成装配前端,也没有变成灵巧手的 teacher。我的 take:抓取检测作为模块已经够好,好到下游系统懒得集成它——端到端策略自己学抓,代价是每个下游都要重新付一份仿真账单。EconomicGrasp 降低的是检测器的训练账单,降低不了这份重复账单。
对 13 篇种子的评价:它们把平行夹爪抓取从「要不要仿真」推到「检测模块可以买」,覆盖了方法论(DR、DA)、数据(Dex-Net、ACRONYM、GraspNet)、表示(6-DoF 全家)和成本(EconomicGrasp)。完全没覆盖的是多指抓取、力闭合之后的操作、以及任何端到端策略。另外两条线不是它的延续,是它把感知做完之后,控制问题重新变得可见。
那套共用的工程语言,在这里分别指什么¶
GPU 并行仿真对抓取线是最弱的那一句话。Dex-Net 和 ACRONYM 的「大规模」是离线渲染和离线物理试抓,可以在 CPU 集群上跑一夜,不必 Isaac Gym。VGN 的 10 ms 是推理延迟,不是训练并行。2021 年之后没人靠「更多并行环境」刷出新的抓取检测 SOTA。这句话是另外两条线的身份证,在这里只是远亲。
域随机化反而是这条线贡献给另外两条的遗产。Tobin 2017 的那句话——真实世界只是训练分布里的一个样本——被 DeXtreme 的 ADR、DextrAH-RGB 的照片级随机化、Factory 的位姿噪声反复引用。抓取线自己反而在 2019 年之后越来越少用它:深度点云的域间隙小,GraspNet 直接用真机图,翻译器派退出。贡献者和使用者不是同一批论文。
特权蒸馏几乎不出现。GQ-CNN、Contact-GraspNet、AnyGrasp 都是监督学习,标签是解析度量或仿真成功,没有「上帝视角 teacher」。RCAN / GraspGAN 的 agent 更接近另外两条的策略,所以它们才需要翻译器。M2T2 用 transformer 做多任务,仍是监督分割,不是 RL 蒸馏。
翻译成方言:并行的是离线标签工厂,随机化是方法论出口而不是本线主粮,蒸馏基本缺席。 把抓取线和另外两条收进同一张「sim-to-real 工程语言」表里,容易造成一种错觉:它们在做同一种系统。它们不是。抓取线做的是可插拔检测模块;另外两条做的是闭环策略。模块成熟得更早,也更早停止生长。
Further Reading¶
- Dex-Net 1.0 / 4.0—— 2.0 的前后代,4.0 把吸盘和夹爪放进同一套合成框架。
- QT-Opt(Kalashnikov et al., CoRL 2018)—— 真机 RL 对照,读它才能理解 GraspGAN 的「50 倍」是在跟谁比。
- VPG(Zeng et al., IROS 2018)—— 推–抓协同,真机自监督,是「不仿真」的另一端。
- PointNetGPD / GSNet—— GraspNet 协议上 AnyGrasp 之前的开源 SOTA,EconomicGrasp 的直接比较对象。
- SuctionNet-1Billion / TransCG—— GraspNet 组自己的吸盘和透明物体延伸,说明「1Billion」协议比夹爪论文活得长。
- 6-DOF GraspNet 的后续 refinement / collision 工作—— 采样流水线没有死,只是退出了种子名单。
- Scale-balanced grasp / 小物体抓取论文—— GraspNet Novel AP 只有 20 左右,缺口在这里。
- 功能抓取 / affordance 文献(从 AffordanceNet 到近期语言条件抓取)—— 下一条主问题很可能从这儿长出来。
- Tobin 之后的 ADR / automatic DR—— 灵巧手 DeXtreme 用的自适应课程,根在这篇 2017。
- James 等后续的 Q-attention / RLBench—— RCAN 作者把翻译器经验带进了操作基准,而不是继续做 GAN。
- Contact-GraspNet 工业复现与二次开发(各种 ROS wrapper)—— 看开源方法实际活在哪些机器人上。
- 深度相机失效案例(透明、黑色、阳光)综述—— 用来判断「深度零样本」这句话的适用范围。
- M2T2 同时期的物体中心操作(Where2Act、O2O-Afford)—— 接触区域作为动作接口,比 6-DoF 位姿更接近装配。
- Factory / IndustReal 的感知前端段落—— 装配线怎样(不)使用抓取检测。
- DextrAH-G 对夹爪抓取的 implicit baseline—— 灵巧手论文里通常会放一个平行夹爪对照,用来校准 87% 和 93.3% 不是同一任务。
收尾¶
把这条线读成「抓取网络一年比一年准」会错过它真正改变的东西:2017 年之后,抓取不再是必须上真机才能研究的问题。随机化解决了图像,解析度量解决了标签,GraspNet 解决了分数,AnyGrasp 解决了能不能卖。剩下的分数在 Novel 物体、在功能朝向、在 RGB、在开源。这些分数值得抠,但不该再占用「机器人学习下一代是什么」的带宽。另外两条线已经把问题换成了安全动作空间和亚毫米接触;夹爪抓取是它们共用的、几乎被做完的前置模块。