先造能跑螺纹的仿真器:Factory 装配线¶
横纵分析法 · Papers 版 — 种子论文 8 篇(2022–2026)
Executive Summary¶
夹爪装配这条线的起点,不是一个更好的策略,而是一句很硬的工程诊断:接触密集的装配在仿真里根本跑不快、跑不准,所以谈不上用 RL 去学。 NVIDIA 的 Factory(RSS 2022)先用 SDF 碰撞和接触点归约,让一千个螺母–螺栓同时在 GPU 上实时转起来。之后六年,同一组人几乎按「每年补一个瓶颈」的节奏推进:IndustReal 补算法和部署积分器,AutoMate 补几何多样性,FORGE 补力,SRSA 补技能复用,MatchMaker 补资产生成,Refinery 补部署期方差,SPARR 承认零样本到头了、在真机上学 residual。
这不是自然涌现的学术分叉,是一条被管理过的产品路线。真机数字的爬坡也写得很整齐:IndustReal 单技能 83–99%(600 trial),AutoMate specialist / generalist 86.5% / 84.5%,SRSA 迁移后 90%,MatchMaker 生成件 82%,Refinery 把 10 个零件上的 76/100 拉到 97/100,SPARR 在 10 个二零件任务上 95–100%,相对零样本 AutoMate 成功率 +38.4%、周期 −29.7%。
当前争论已经不在「仿真装配能不能迁到真机」——这件事 2023 年就被 IndustReal 做实了。现在争的是:新零件从哪来、力要不要进策略、零样本还要不要坚持、以及 80% 这种研究可用的成功率怎么变成产线可用的 99%。我的判断:SPARR 是这条线第一次公开认输零样本原教旨,接下来 1–2 年 residual / 真机微调会变成默认最后一公里,而 MatchMaker + SRSA 会决定它能不能从 100 个零件长到 1000 个。
装配不是抓取,先过的是仿真这一关¶
抓取线在 2017 年就能用合成点云训练网络,因为「抓得住」主要是几何和摩擦的粗问题。装配是另一类:间隙经常小于 1 mm,接触模式会在滑动、卡住、楔入之间跳,螺纹这种几何在网格碰撞里是噩梦。在 Factory 之前,装配仿真的主流是 MuJoCo / PyBullet 上的 peg-in-hole,零件大、间隙宽、还经常靠力传感器过关。NVIDIA 的诊断是:不是 RL 不行,是仿真器先不行。
2022:把「接触」变成 GPU 上的批量运算¶
Factory(arXiv:2205.03532,RSS 2022;Narang、Handa、Fox)的贡献清单读起来像一份仿真器发布说明:SDF 碰撞、接触点归约、Gauss-Seidel 求解器,一千个螺母–螺栓同时实时交互;外加 60 个零件模型、3 个装配环境、7 个控制器,以及一个证明「这东西能拿来训 RL」的 nut-and-bolt 策略。项目页和后来的 Isaac Lab 集成,比论文本身的策略数字更重要。它改写的 default assumption 是:「接触丰富 = 不能大规模并行」。改完之后,后面所有人必须表态:你的装配方法是建立在能跑螺纹的仿真器上,还是还在用宽间隙 peg-in-hole 讲故事。
技术上,Factory 做对的是把碰撞从「网格对网格」改成 SDF 查询,再把接触点从「能有多少算多少」收成可并行的小数目。螺纹这种几何在三角网格里会产生成百上千个接触候选,把求解器打死;SDF 把距离场做成可微、可批量化的查询,Gauss-Seidel 再在 GPU 上扫这些接触。一千个螺母–螺栓同时转,不是为了炫,是为了让 PPO 的并行环境数达到和抓取、运动控制同一量级。没有这个量级,后面的 SDF 奖励和课程都只是单机玩具。
Factory 自己没有把 sim-to-real 做完。它甚至没有假装做完。论文的定位是工具,proof-of-concept 策略只为了证明工具不是玩具。这让它和同年的 DeXtreme 形成有趣对照:灵巧手线先证明策略能过真机,装配线先证明仿真器能存在。两条线后来共用 Isaac 生态,但它们对「第一瓶颈是什么」的判断从第一天起就反着来。
2023:仿真会跑了,策略还是学不会插¶
IndustReal(arXiv:2305.17110,RSS 2023;Tang、Fox、Narang)写得很坦白:同一套 Factory 环境,Pick 和 Place 用常规 RL 就能训出来,Insert 只有约 12%。于是他们补了三件仿真期算法,再补一件部署期算法。
仿真期三件。Simulation-aware policy updates(SAPU):别假装仿真器给的每一步都物理正确,更新策略时把仿真器自己的可信度考虑进去。SDF-based dense reward:插入这种「要么进要么不进」的任务,稀疏成功奖励探索不动;SDF 把「还差多远才啮合」变成处处有梯度的几何量。Sampling-based curriculum(SBC):从容易的初始分布慢慢放到难的,而不是一上来就随机位姿。
部署期一件。Policy-level action integrator(PLAI):策略输出的是增量,部署时把增量积成目标,再交给任务空间阻抗。他们测到稳态误差大约 2 mm,优于不用 PLAI 的策略,也优于 Franka 自带 TSI 的 4.45 mm。接触时积分器会 windup,所以有 Leaky PLAI 做钳位。
真机系统把检测、抓取、对齐、插入串起来,600 trial、成功率 83–99%,不在真机上再适应策略。作者称这是「装配全阶段 sim-to-real」的第一次。硬件是常见的 Franka Panda,后来也跑过 UR10e。配套放出 IndustRealKit(NIST Task Board 1 风格的 3D 打印件)和 IndustRealLib(Isaac Gym checkpoint 往真机灌)。
真机数字需要拆开读。83–99% 是分阶段的:Pick、Place、Insert、以及串起来的 PPI 不是同一个难度。Insert 实验里零件被「不精确地」放在夹爪里,目标带 ±2 mm 噪声,peg 啮合率 86.7%、齿轮 95%、未见过的 NEMA 插头 100%——插头数字好看,部分因为插座几何本身在引导。作者也展示了人推一把之后的恢复、以及三脚插头的搜索行为,用来说明策略不是开环插进去。Limitation 写得很有用:失败主要是夹爪里打滑和楔入;他们当时就把 visuotactile 和更好的摩擦仿真列为下一步,这两步分别由 FORGE / TacSL 和仿真器迭代去接。
这里有一个被后续论文反复引用、也反复打脸的数字:Insert 从约 12% 到能用,靠的是 SDF 奖励和课程,不是更大的网络。装配的样本效率问题,本质是奖励塑形和初始分布,不是模型容量。AutoMate 后来用模仿目标把 IndustReal 在 100 个零件上的均值 38.45% 衬得很惨,说明 2023 年的「成功」高度绑定在少量 NIST 风格几何上。IndustReal 自己点过这件事:主要任务来自 NIST。把这篇读成「装配已经解决」,是 2023 年能犯、2024 年不该再犯的错。
2024 上半年:零件从「几个」变成「一百个」¶
AutoMate(arXiv:2407.08028,RSS 2024)把问题从「一个孔能插」换成「一类孔都能插」。100 套仿真兼容装配资产;大约 80 个任务上训 specialist,20 个任务上蒸馏出 generalist。训练不是纯 RL:assembly-by-disassembly(先拆再学装,等于白送一条可行轨迹)、RL 加模仿目标、再用 DTW 做轨迹对齐。消融写得很不客气——在 100 个零件上,IndustReal 均值 38.45 ± 32.16%,状态匹配 59.11%,DTW 81.50%,signature transform 77.46%。模仿不是锦上添花,是从「会几个」到「会八十个」的必要条件。
真机:specialist 在 20 个装配、200 trial 上 86.5%(相对仿真只掉 4.2 个点);generalist 84.5%,甚至比仿真的 80.4% 更高。感知初始化的 5 个装配 86–90%。NVIDIA 技术博客把这组数字当成「零样本 sim-to-real 已经和仿真等价,有时更好」的证据。我的读法更谨慎:真机插座往往有未建模的柔性,MatchMaker 后来自己承认过「真机比仿真高,是因为夹具会让一点」。AutoMate 的「真机高于仿真」可能有一部分来自这种物理送分,不是策略真的更强。
同一时期的横向对照:灵巧手线的 DextrAH-G 也是 2024 年 7 月。一个在刷 23-DoF 抓取,一个在刷 100 个夹爪装配几何。共用的作者是 Van Wyk / Fox / Narang 这层,但论文引用彼此并不多。两条线在 2024 年仍然是同一栋楼里的两个产品。
2024 年 8 月:力被当成可条件化的输入,而不是必须仿真准的状态¶
FORGE(arXiv:2408.04587,RA-L 2025;Noseworthy、Narang、Akinola)补的是 IndustReal limitation 里点过、但算法上一直躲开的轴。接触力在仿真和真机之间对不齐,所以前几篇几乎不用力传感器当观测。FORGE 的绕法是:不要预测力,要条件在「最大允许力」上。 训练时把力阈值和动力学随机化绑在一起;部署时同一个策略可以根据阈值变得大胆或保守,与控制器增益无关。策略还预测任务成功,用来提前结束和自动调阈值。演示任务包括卡扣连接器的用力插入,以及行星齿轮这种要连过三步的装配。
这是一个很「这条线」的解决方案:遇到仿真不准的物理量,就把它改写成策略的条件输入或几何代理,而不是先把仿真器做完美。灵巧手线 ADEPT 后来对触觉做了类似的事(穿透深度图而不是仿真力)。两边都在实践同一条启发式——能对齐的写进观测,不能对齐的写成阈值或几何。
2025 年 3 月:技能库和资产工厂同一周出现¶
SRSA(arXiv:2503.04538,ICLR 2025 Spotlight;Guo、Tang、Gupta、Narang)假设你已经有一柜子 specialist。新任务来了,问题变成:微调哪一个?他们的关键假设是:零样本成功率高的技能,微调起来也快。 于是先训一个迁移成功率预测器,特征联合了几何、动力学和专家动作,再用预测结果检索技能。相对 leading baseline:成功率相对提升 19%,跨 seed 标准差低 2.6×,达到可用成功率的 transition 少 2.4×。真机均值 90%。
MatchMaker(arXiv:2503.05887,ICRA 2025;Wang、Tang、Narang、Akinola)解决的是柜子本身怎么变大。AutoMate 的 100 个资产仍然是人手策展的。MatchMaker 用生成式管线:给一对互相穿透的 mesh 自动修成仿真兼容、无穿透的一对;给单个零件生成几何配合的对偶件;再按用户指定的间隙腐蚀接触面。真机验证是 5 对生成件、每对 10 trial,均值 82%。作者明确写了真机略高可能来自插座夹具的柔性。
两篇论文同一周出现,不是巧合。SRSA 在资产数量已经够检索时才有意义;MatchMaker 在检索和微调已经能用时才有意义。它们把这条线从「展示 100 个零件」推向「零件供给可以自动化」。还没做的实验是把两篇接起来:MatchMaker 源源不断造件,SRSA 自动挑技能微调。这个 2×2 现在空着。
2025 年 10 月:80% 对研究够了,对产线和对链式装配不够¶
Refinery(arXiv:2510.11019,ICRA 2026;Tang、Gupta、Narang)的开篇数字是一种自我批评:仿真学习已经能把接触密集装配做到约 80%,但这低于工业标准,而且让策略串联变得极脆——每一步 80%,八个零件连乘就接近零。他们把剩余误差主要归因于同一策略在不同初始条件下方差太大。
两剂药。训练期:贝叶斯优化指导的主动微调,专门打那些失败的初始条件。部署期:用仿真数据拟合 GMM,采样更容易成功的初始化。仿真上相对 SOTA +10.98%,到 91.51%。真机 10 个二零件装配、每个方法 10 trial:baseline 76/100,只微调 92/100,完整 Refinery 97/100。难件(如 01053、00190)从 12/30 拉到 27/30;本来就不错的件维持满贯。链式装配可以零样本接到 8 个零件,子任务全自动成功率 90.6%(146/160)。失败时仍有人介入——「8 零件成功」和「无人值守 8 零件成功」不是同一句话。
Refinery 把这条线的目标函数从「平均成功率」改成了「跨初始条件的稳健性 + 可串联」。这是成熟期信号:主算法不再换,开始抠部署。
2026 年 2 月:承认零样本有残差,残差交给真机¶
SPARR(arXiv:2602.23253,ICRA 2026;Guo、Akinola、Gupta、Narang)是八篇里哲学转折最大的一篇。前六年的官方语言是 zero-shot sim-to-real、真机不再适应。SPARR 说:仿真基策略冻住,在真机上学一个非对称 residual。基策略吃低维状态、稠密奖励,负责「大方向对」;residual 吃视觉、稀疏奖励,负责动力学误差和传感器噪声。真机训练约 0.5 小时/任务,无人示范、无人介入。
10 个二零件任务上 95–100%。相对零样本 AutoMate,成功率相对 +38.4%,周期 −29.7%。对照 SERL(纯真机 RL、无仿真先验)在半小时里几乎学不会;对照 HIL-SERL(有人介入的 oracle)成功率打平,周期仍慢一截——作者把周期差距部分归给 PLAI 和平滑,部分归给人类示范本来就更快。项目页还写过另一组数字:在相关任务上适应基策略时,相对提升 74.5% 成功率和 36.5% 周期。
非对称(asymmetric)是这篇的方法词,不是修辞。基策略和 residual 的观测、奖励、训练域都不对称:一边是仿真里的稠密状态,一边是真机上的稀疏视觉。这和经典 residual RL(两个策略吃同类观测、残差只是动作加法)不同。好处是基策略对视觉域间隙免疫——它根本不看图,所以外观随机化失败伤害不到它;坏处是 residual 必须在基策略已经能偶尔成功的区域里学,否则稀疏奖励没有正样本。SERL 对照饿死,就是因为没有这个区域。
SPARR 没有否定 Factory 到 Refinery 的六年。它把六年产出的东西定义成 prior,把最后 10–20 个点定义成必须在实物上付的税。这和灵巧手线仍然坚持零样本 student、和抓取线用解析度量避免真机 RL,都不同。装配线碰到了自己的精度天花板:亚毫米接触的残差,域随机化覆盖不住。一个该追问的细节:0.5 小时是 wall-clock 还是有效接触时间,复位谁来做,失败了谁把零件拔出来。论文强调无人示范、无人介入,没有同等强调复位自动化。产线复现时,半小时往往变成「半小时加一个看着的人」。
2022 Factory 仿真器:SDF + 接触归约 + GPU
2023 IndustReal 算法:SDF 奖励 / 课程 / PLAI 真机 83–99%
2024 AutoMate 几何:100 资产,专家 + 通才 86.5 / 84.5%
2024 FORGE 力:阈值条件化
2025 SRSA 复用:技能检索 + 微调 真机 90%
2025 MatchMaker 供给:生成配对资产 真机 82%
2025 Refinery 部署:BO 微调 + GMM 初始化 76 → 97 /100
2026 SPARR 残差:冻仿真策略 + 真机 residual 95–100%
一条产品路线上的四次表态¶
因为作者高度重叠,横向对比如果做成「不同实验室的哲学斗争」会假。更真实的横向,是同一组人在不同年份选择站在哪个瓶颈上,以及这些选择现在还能不能并存。
零样本还是最后一公里真机学习¶
2023–2025 的官方立场是零样本。IndustReal 把「no real-world policy adaptation」写进贡献列表;AutoMate、MatchMaker、Refinery 的真机数字都是部署,不是再训。SPARR 把这扇门打开了。
两端的前提。零样本假设域随机化 + PLAI + 几何奖励已经覆盖主要 sim-to-real 通道。对厘米级抓取、对宽松间隙,这个假设经常成立;对卡扣、螺纹、亚毫米孔,FORGE 和 SPARR 的存在本身就是反证。真机 residual 假设基策略已经能给出足够多的成功轨迹当先验,否则稀疏奖励的 residual 会像 SERL 对照那样饿死。SPARR 能 0.5 小时学成,是因为 AutoMate 级的基策略已经会「大概那么插」。
用户侧(工厂)并不在乎零样本教义,在乎换线时间和良率。开发者侧(这篇论文的作者们)在 2023 年需要零样本来证明仿真器值钱;2026 年仿真器已经值钱了,教义就可以松。我的 take:零样本不会消失,它会退成「出厂默认」,residual 会变成「上线必做」。和 HIL-SERL 的对比还说明一件事——人类介入能换周期,换不来 SPARR 在意的「不需要专家」。
Specialist 一件一策,还是 Generalist 一个网络¶
AutoMate 同时做了两个,并且没有宣布其中一个胜利。Specialist 在单件上更稳,generalist 在 20 件上 84.5% 已经能用。SRSA 是 specialist 世界观的续集:件多了就检索,不要强行一个网络吃所有几何。MatchMaker 则在给两个世界观同时供货。
这个轴和灵巧手线的「一任务一训 vs ADEPT 预训练」同构,解法不同。装配线的不变性在零件几何,所以他们把几何塞进 PointNet 式编码器,做蒸馏和检索。灵巧手线的不变性在手的运动学技能,所以他们预训 reposing。两边都还没做出「任意件 + 任意手」的那个交叉格子。
证据上,我站 specialist + 检索这一端,至少在接触精度仍由几何细节决定的时候。AutoMate 自己的 100 件消融显示,离开模仿和件级专家,IndustReal 式通才会塌到 38%。Generalist 的 84.5% 是在 20 件、而不是 100 件上测的。把 generalist 外推成「装配基础模型」证据不足。
力、视觉、状态:观测里到底放什么¶
Factory 到 AutoMate 的部署策略主要吃低维状态加一点视觉位姿。FORGE 把力阈值放进条件。SPARR 的 residual 改吃视觉。没有一篇种子论文把高维力/触觉序列当作主观测——TacSL 被索引明确排除在主线外。
这是刻意的。接触力过不了域,视觉外观过域要靠随机化,状态过域最便宜。所以这条线的 teacher 永远是状态,student 能少看传感器就少看。代价是:一旦位姿估计错了,整条链路跟着错。IndustReal 的感知是 2D 位姿(x, y, θ);AutoMate 有感知初始化实验,但主表仍偏状态。SPARR 用视觉 residual 去补的,恰好是这条最便宜观测链的账单。
空白位置:以触觉或 6 轴力为主观测、状态只当特权 teacher 的装配策略。FORGE 靠近它,但力仍然是标量阈值,不是信号。
资产从哪来:手做、扫描,还是生成¶
2022 年 60 个零件,2024 年 100 个装配,2025 年 MatchMaker 自动成对。这条轴几乎没有争论,只有供给速度。真正的争论在生成件的物理保真:间隙怎么设、材料怎么对、螺纹这种功能几何生成器会不会造出仿真能装、真机装不上的鬼件。MatchMaker 的 82% 来自「仿真里已经很高」的 5 对,不是从生成分布里随机抽的。这是正向选择。
和抓取线的 ACRONYM / GraspNet 比,装配线还没有一个「一百万对装配」的公共基准。谁先把 MatchMaker 式生成做成可检验的开放资产库,谁就定义下一阶段的 leaderboard。现在 100 件仍然是内部策展。
设计空间地图¶
| 工作 | 攻击的瓶颈 | 零样本? | 技能形态 | 观测 | 真机主数字 |
|---|---|---|---|---|---|
| Factory | 仿真接触算得动 | 未做真机主结果 | 单任务 RL | 状态 | 工具论文 |
| IndustReal | 插入学不会 + 部署误差 | 是 | 单技能 | 状态 + 2D 位姿 | 83–99% / 600 |
| AutoMate | 几何多样性 | 是 | 专家 + 通才 | 状态 / 点云编码 | 86.5 / 84.5% |
| FORGE | 大力接触 | 是 | 力条件化策略 | 状态 + 力阈值 | 卡扣 / 行星齿轮演示 |
| SRSA | 新任务从零训太贵 | 先检索再微调 | 技能库 | 几何+动力学+动作特征 | 90% |
| MatchMaker | 资产策展 | 是(生成件) | 供给层 | — | 82% / 5 对 |
| Refinery | 初始条件方差 | 是(部署优化) | 同策略,换初始化 | 状态 | 76 → 97 /100 |
| SPARR | 不可随机化的残差 | 否,真机 residual | 基策略冻 + 视觉残差 | 状态 / 视觉 | 95–100% |
聚类:2023–2025 是「零样本仿真派」,2026 是「混合派」。Fox / Narang / Tang / Akinola / Guo 贯穿全程。Gupta(华盛顿大学)从 SRSA 开始深度加入,恰好出现在路线从展示转向复用和残差的时候——学术合作者往往在「需要新问题定义」而不是「需要再做一个零件」时进场。
六年补完一条流水线之后,缺的是开放基准¶
成熟度:rapid convergence 的尾声,mature optimization 的开头。算法主框架(GPU 仿真 + PPO + SDF 奖励 + PLAI)从 2023 年起没换过,换的是周围的供给、检索、部署和残差。这是一条工程上很健康、学术叙事上开始重复的曲线。
Open problems:
- 公共、不可作弊的装配基准。 现在的 100 件、10 件真机、5 对生成件,都由同一组人定义成功。和 GraspNet-1Billion 那种外部可提交的评测协议比,装配线还是内部 demo 联邦。
- 生成资产的物理合格率。 MatchMaker 证明能造,没证明随机抽一件的真机合格率。
- 力 / 触觉何时必须进主观测。 FORGE 用阈值绕开了,SPARR 用视觉残差绕开了。碰到润滑、变形、软配合,绕法会失效。
- 串联装配的无人值守。 Refinery 的 8 零件仍允许人介入。产线要的是停线率,不是「算上人工修正的成功」。
轨迹预测(1–2 年):
- Residual 会成为论文标配,而不是离经叛道(高)。SPARR 的对照太完整:纯真机 RL 不行,纯零样本不够,混合刚好。后面的工作会把 0.5 小时再压短,而不是回到纯零样本。
- MatchMaker × SRSA 会被接起来做成自动产线(中)。技术上没有障碍,缺的是一篇把「生成–检索–微调–Refinery–residual」串成系统的论文。
- 和新的 VLA / WAM 路线碰头(低到中)。装配线目前完全不碰语言和视频生成。若工厂侧的需求是「看图纸装配」而不是「看 CAD 装配」,这条线必须接一个语义前端。现在还没有种子论文往那边走。
和抓取线比,装配线从来没有一个 GraspNet。这不是疏忽,是接触任务的评测 intrinsic 更难:成功依赖间隙、材料、润滑、夹具刚度,换一套 3D 打印公差数字就动。但也正因为难,才更需要外部协议。现在的 97/100 和 95–100% 都是作者自己的 3D 打印件、自己的复位、自己的成功定义。我作为读者选择相信数量级,不选择相信小数点后的点。
对八篇种子的评价:它们几乎完整地覆盖了「仿真器–奖励–多样性–力–复用–供给–部署–残差」这条流水线,覆盖率高到有点不像学术集群、更像产品 backlog。没覆盖的是开放评测、软体 / 线缆 / 变形装配,以及任何不以平行夹爪为末端的装配。灵巧手线的 ADEPT 正在从另一头摸插装;两边还没有共享一个任务定义。谁先把 FMB peg 和 Factory 零件放进同一张表,谁就强迫两条线说话。
那套共用的工程语言,在这里分别指什么¶
GPU 并行仿真在装配线上首先是 接触算得动。Factory 的一千个螺母不是为了视觉 batch,是为了让 Gauss-Seidel 在 SDF 接触上和 PPO 的环境数匹配。Isaac Lab 后来把这些环境收成产品,是这条线对社区最实在的交付,比任何一次 97% 都实在。灵巧手线同一年也在用 Isaac Gym,但他们的瓶颈是视觉显存,不是螺纹接触。
域随机化在这里被用得很克制。IndustReal 随机位姿、加观测噪声,却避免动力学随机化——插入对间隙和摩擦太敏感,随机重了策略会学一套仿真里才成立的「撞进去」。FORGE 把动力学随机化和力阈值绑在一起,是有条件的随机。SPARR 更进一步:能随机化的交给基策略,随机化不了的交给真机 residual。所以装配线说「域随机化」时,意思接近「把初始条件和传感器噪声盖住」,不是 Tobin 那种「贴纸贴满仿真器」。
特权蒸馏存在,但不是主叙事。AutoMate 的 generalist 从 specialist 蒸馏,SRSA 检索的是现成技能而不是像素 student。部署时策略主要吃低维状态,视觉常常停在位姿估计前端。SPARR 的 residual 才第一次让视觉进到真机学习环。和 DextrAH「没有 student 就没有论文」相比,装配线可以靠状态策略 + PLAI 先发一篇。
翻译成方言:并行的是接触,随机化的是位姿不是动力学,蒸馏是可选项,最后一公里可以不蒸馏、改在真机上加 residual。 谁要复用这条线,先去 Isaac Lab 把 Factory 环境跑起来,不要先复现 97%。
Further Reading¶
- NIST Assembly Task Board—— IndustReal 几何来源,读它才能看懂「83–99%」对应的是哪一类工业玩具。
- Isaac Gym / Isaac Lab—— Factory 环境的栖息地;复现这条线从这里开始,不是从某一篇算法论文开始。
- HIL-SERL / SERL—— SPARR 的真机 RL 对照。想判断 residual 是不是在偷换「无人监督」,必须读它们的介入协议。
- InsertionNet 及其力觉插入后继—— 另一条「插入=视觉+力」的线,用来对照 FORGE 为什么把力写成阈值。
- TacSL(arXiv:2408.06506)—— 索引指定的装配线卫星工作,触觉仿真库。
- Contact-implicit trajectory optimization(C3、CI-MPC、IMPACT)—— 不走 RL 的接触规划对照,说明 80% 不是物理极限。
- Assembly-by-disassembly 更早的运动规划文献—— AutoMate 把老想法嵌进 RL,不是从零发明拆装对偶。
- PointNet / 点云编码器在操作上的用法—— AutoMate generalist 的几何接口。
- DTW / signature transforms 在轨迹模仿中的用法—— AutoMate 消融里真正拉开 38% 和 81% 的东西。
- 域随机化经典论文(Tobin 2017,见抓取线)—— 这条线吃方法论、几乎不引用抓取网络,但 DR 是共同祖先。
- OpenAI Rubik / DeXtreme—— 用来问:为什么装配不走灵巧手,灵巧手 2026 年又走回插装。
- π*₀.₆ RECAP / RLT—— VLA 侧的「经验后训练」,和 SPARR 的 residual 是不同接口上的同一直觉。
- MatchMaker 所用的 shape completion / diffusion 骨干—— 资产生成的上限不在装配算法,在生成模型是否尊重功能几何。
- Franka / UR 任务空间阻抗控制工程文献—— PLAI 之所以 2 mm,有一半是控制器,不是策略。
- 「仿真可信度 / simulator discrepancy」更早的 sim-to-real 工作—— SAPU 不是第一篇怀疑仿真器,但是第一篇把它写进装配 PPO 更新。
收尾¶
Factory 线最值得学的不是某一个 97%,而是它给自己出题的方式:每次只承认一个瓶颈,做完就写进下一篇的 related work 当已经关闭的假设。2022 年关闭「仿真跑不动」,2023 年关闭「插入学不会」,2024 年关闭「只会一种孔」,2026 年关闭「零样本教义」。还开着的题是开放基准和软接触。谁要跟这条线竞争,不要再做一篇 peg-in-hole 的 SDF 奖励;要做的是让 100 个零件变成别人也能提交结果的 1000 个零件,或者证明 residual 半小时能在没有 NVIDIA 基策略的机器人上成立。