跳转至

RoboTTT: Context Scaling for Robot Policies

论文阅读笔记 — 用于后续讨论的概览


1. 基础信息

  • 题目: RoboTTT: Context Scaling for Robot Policies (Test-Time-Training Robot Policies)
  • 作者: Yunfan Jiang¹˒², Yevgen Chebotar¹, Ruijie Zheng¹, Fengyuan Hu¹, Yunhao Ge¹, Jimmy Wu¹, Tianyuan Dai¹˒³, Scott Reed¹, Li Fei-Fei²˒†, Yuke Zhu¹˒³˒†, Linxi "Jim" Fan¹˒† — ¹NVIDIA (GEAR), ²Stanford, ³UT Austin
  • arXiv 编号: 2607.15275 (submitted 2026-07)
  • 关键词: Long-Context Policies, Test-Time Training, Robot Foundation Models, fast weights, VLA, GR00T N1.7, DAgger Distillation

RoboTTT teaser Figure 1:RoboTTT 把 TTT 融进 robot foundation model,把 visuomotor context 从主流 VLA 的 1 步(<0.1 秒)扩到 8K timesteps(30 Hz 下约 4 分半),解锁一次性人类视频模仿与 on-the-fly 自我改进两类新能力。

2. 文章介绍

2.1 解决的领域和问题

Robot foundation model / VLA 领域的 context length 问题。当前 SOTA 的 VLA(GR00T、π₀/π₀.₅、OpenVLA、SmolVLA 等)几乎全是 single-step 或 2–8 帧短历史条件,policy 每几帧就"失忆"一次。相比之下 LLM 早已把 context length 当作核心 scaling 轴。论文问的问题是:如何构建能从任意长 visuomotor context 中学习并利用它的策略?——不是把长程记忆外包给 keyframe / language memory bank(π₀.₆-MEM、BPP 那条线),而是保留稠密的视觉-动作原始流。

2.2 Motivation

长 visuomotor context 直接对应三类能力:(1) 从 in-context 人类视频演示做 one-shot imitation(任务配置只能从视频里读出来);(2) 从自己部署历史中 on-the-fly 改进(Algorithm Distillation 式的 in-context policy improvement);(3) 多阶段长程任务的闭环表现——视觉相似的阶段会造成 state aliasing,没有历史就会跳步或重复。三个技术挑战:编码长历史需要足够容量;条件了 context 还要真的它(而不是学出 spurious correlation);推理开销必须与 context 长度无关(Transformer 即使有 KV cache,解码延迟也随历史线性增长)。TTT 的 fast weights 恰好同时满足三条:fast model(MLP)比 RNN 的向量状态容量大;测试时梯度下降天然做"保留显著、丢弃冗余"的压缩;权重前传使推理成本恒定。

2.3 之前工作的问题

类别 代表工作 缺陷
单步/短历史 VLA GR00T N1.7、π₀/π₀.₅、OpenVLA 无记忆,state aliasing 下跳步/重复;naive 拼历史帧还会引入 spurious correlation(本文实测 GR00T+1 帧历史在 Pup Go Car 上 39.5% 反低于无历史的 57%)
全历史自回归 policy Gato、VIMA、RoboCat、ICRT 捕捉长依赖但部署不可行:KV cache 下解码延迟仍随 context 线性增长
传统 RNN policy LSTM 类 (robomimic) 推理恒定开销,但向量状态容量小、scaling 差于 attention
语义外部记忆 MEM、BPP、keyframe/language memory 把历史压成高层语义,丢掉了 one-shot 视频模仿、细粒度纠错所需的稠密视觉-动作信息
线性递归记忆 Gated DeltaNet (本文的 GDN baseline) 固定大小状态但更新规则是线性关联、无测试时梯度下降,实验显示编码了 context 却用不好(one-shot 0/10),且 context scaling 无增益
机器人界的 "TTT" EVOLVE-VLA、TTT-RL 类 名为 test-time training 实为在测试任务上收集数据微调全模型,不是 fast weights 机制

2.4 论文解决方案(一句话)

在 GR00T N1.7 的 DiT action head 每层 attention 后插入 TTT 层(fast weights = 两层 MLP,训练与推理时都做梯度更新,把历史压进权重空间),配合 sequence action forcing(每个 action chunk 独立采噪声水平)+ TBPTT(梯度截断在 segment 内、fast weights 跨段传递),把训练 context 扩到 8K timesteps 且推理开销恒定,并首次给出"预训练 context 越长、闭环性能越好"的 context scaling 曲线。

2.5 与前序工作的关系

  • Backbone 直接复用 GR00T N1.7(Eagle VLM + 538M DiT flow-matching action head),预训练阶段冻结原模型、只训新加的 TTT 层;宣称 plug-and-play 可适配任意 VLA。
  • TTT 机制沿用 Sun et al. 2024 / Zhang et al. 2025 的 "update then apply" 框架与 meta-learned \(W_0\)(MAML 式 gradients-of-gradients)。
  • DAgger Distillation 明确自我定位为 Algorithm Distillation(Laskin et al.) 在真机器人上的实例化:把人类 DAgger 干预诱导的改进过程蒸馏进 fast-weight 适应。
  • 最接近的先行者是 ViTA(Ziakas et al. 2026,给 VLM 加 fast weights 学 value function);本文是首个把 TTT 层做成 visuomotor policy 本体的工作。
  • \(\tanh\) gating 借自 Flamingo;register token 借自 Perceiver / ViT registers;预训练数据混合了 EgoScale 的 egocentric 人类数据。

3. 方法介绍

3.1 形式化

TTT 机制:对 token 序列的投影 \(Q, K, V\)(投影矩阵 \(\theta_Q,\theta_K,\theta_V\) 属于 slow weights),fast weights \(W\) 参数化小网络 \(f_W:\mathbb{R}^d\to\mathbb{R}^d\)。每个时刻先更新

\[W_t \leftarrow W_{t-1} - \eta \nabla_W \| f_{W_{t-1}}(K_t) - V_t \|^2,\]

应用\(O_t = f_{W_t}(Q_t)\)。update 把上下文写进参数空间,apply 把它取出来。\(\eta\) 可学习(基准值 0.1),\(\theta_{Q,K,V}\) 与初始化 \(W_0\) 由外层任务损失端到端学出——即 \(W_0\) 是 meta-learned 的。推理时等价于把已处理 token 压缩进 fast weights,而 full attention 需要存所有 K/V 并每步 attend。

Robot sequence model:轨迹 \(\xi = \{(l, o_t, q_t, A_t)\}_{t=1}^{T}\)(语言、图像、本体感知、action chunk),学习 \(\pi(A_t \mid \xi_{<t}, o_t, q_t)\),目标是 scale \(|\xi_{<t}|\)

3.2 模型架构:TTT 管时间、attention 管单步

RoboTTT architecture Figure 2:TTT 层加在 DiT 每层 self/cross-attention 之后——attention 只在单个 timestep 内部操作(并 cross-attend 该步的 VL token),TTT 层沿时间维跨 timestep 操作;推理从 meta-learned \(W_0\) 出发,每个观测更新一次 fast weights 并前传。

  • DiT 输入是跨 \(T\) 个 timestep 的序列 \([R_1,\Phi_1,q_1,\tilde A_1,\ldots,R_T,\Phi_T,q_T,\tilde A_T]\)\(\Phi_t\) 是 VLM 输出的 vision-language token,\(q_t\) 本体感知 token,\(\tilde A_t\) 噪声化 action token,\(R_t\) 是每步前置的 \(N{=}16\) 个 learned register token。
  • 分工设计:attention 只处理单步内的 \(R_t, q_t, \tilde A_t\)(cross-attend 当步 \(\Phi_t\));各步输出沿时间拼接后过 TTT 层。VL token 不直接进 TTT 层(计算量原因),靠 16 个 register token 把视觉语言信息带过时间维。
  • \(\tanh\) gating 保护预训练能力\(O = \tanh(\alpha)\odot O_{\mathrm{TTT}} + O_{\mathrm{attn}}\)\(\alpha\) 初始化 0.001,训练初期 TTT 贡献近零,避免破坏 GR00T 预训练计算。

3.3 训练配方:sequence action forcing + TBPTT

  • 序列训练:整条轨迹(或截到最大 context 的连续子轨迹)作为一个训练序列,内层跑 TTT 更新,外层在每个 timestep 计算 flow-matching 损失并对全序列平均:
\[\mathcal{L}_{\mathrm{fm}}(\xi; W_0) = \frac{1}{T}\sum_{t=1}^{T} \mathbb{E}_{\tau_t, \epsilon}\left[\| v_\theta(\Phi_t, A_t^{\tau_t}, q_t; W_{t-1}) - (A_t - \epsilon)\|^2\right].\]
  • Sequence action forcing:每个 action chunk 的 flow-matching 噪声水平 \(\tau_t\) 独立采样(\(\tau_t = s(1-u)\), \(u\sim\mathrm{Beta}(1.5,1)\), \(s=0.999\))。共享一个噪声水平(full-sequence diffusion)会让整条序列一致偏易或偏难,训练不稳定(呼应 Diffusion Forcing 的发现)。消融显示去掉它闭环性能崩掉。
  • TBPTT:序列切 segment,梯度只在 segment 内流动,但 fast weights 跨段传递(数值上 detach)——TTT 覆盖全序列而 GPU 显存只随 segment 长度增长,训练 context 可任意拉长。\(W_0\) 仍通过第一个 segment 收到梯度。
  • 推理:每个 rollout 从 \(W_0\) 开始,逐观测更新 fast weights 并前传,action chunk 用 \(k\) 步去噪生成。

3.4 从异构 context 学习:视频模仿与 DAgger Distillation

核心机制是解耦 fast weight 更新与模仿目标:mask 掉选定 timestep 的 flow-matching 损失,这些步就成为"纯 context"——只写入 fast weights、不做模仿目标。

  • In-context 视频模仿:训练时把同任务配置的人类视频 \(\xi^{\mathrm{video}}\) 与机器人轨迹 \(\xi^{\mathrm{robot}}\) 拼成一条序列,视频段 mask 损失(只更新 fast weights),动作损失只算在机器人段。测试时喂一条未见配置的人类视频即可 one-shot 模仿。
  • DAgger Distillation:DAgger 采集的轨迹里 executed action 要么是机器人自己的 \(A^{\mathrm{R}}_t\)、要么是人类纠正 \(A^{\mathrm{H}}_t\)。标准 DAgger 只在纠正上微调、丢掉次优机器人动作;本文两者都用但角色不对称——全部历史(含失败动作)更新 fast weights,损失只 mask 到人类纠正上。"失败作 context、纠正作 target",把人的 failure-to-correction 映射蒸馏进 fast-weight 适应。测试时模型自主在线纠错,自己的纠正又进入历史被 fast weights 吸收,与训练时人类纠正的角色完全一致。

DAgger Distillation Figure 3:DAgger Distillation 的不对称监督——序列训练中所有 executed action(含机器人自己的失败动作)都更新 fast weights,flow-matching 损失只计算在人类纠正段上。

3.5 Implementation Details

项目
Backbone GR00T N1.7 = Eagle VLM + 16 层 DiT(538M),每层加一个 TTT 层(各 ~10M),DiT 总计 690M
Fast model 两层 MLP + GeLU,标准 GD 更新(Muon 等留作 future work);inner LR 可学习、基准 0.1;RoPE \(\theta{=}10000\)
预训练 桌面双臂机器人数据 + egocentric 人类数据(EgoScale),偏采长轨迹;只训新加的序列层,冻结 GR00T 其余部分;context 渐进增至目标(8K),30K 步,16× GB200
预训练 batch ≤4K context:per-device 4(global 64);>4K:per-device 1(global 16);AdamW wd 1e-5,WSD 峰值 lr 2e-5
Post-training 每任务 1K context、20K 步、8× GB200、全参微调,cosine 峰值 lr 5e-5
部署 YAM 双臂 + 4× RealSense D405(480p RGB:top/bottom/双腕),RTX 5090 工作站,30 Hz 控制频率(8K timesteps ≈ 4 分半)
任务数据 Pup Go Car 8h(均 2 分钟/条)、Circuit 6h(1 分钟,80 配置训 20 测 60)、Gear Bot 5h(5 分钟,十阶段)

4. 结果对比

4.1 主评测:三个长程装配任务

Baseline:GR00T N1.7(单步 context)、GR00T N1.7 Hist.(+1 历史帧)、GDN(TTT 层换成 Gated DeltaNet,层位置/gating/参数量对齐)。序列模型 post-train 用 1K context,非序列模型对齐算力。每任务 20 trials(Gear Bot 10),rubric 打分。

Method 平均完成分 Pup Go Car 全成功 Circuit 全成功 Gear Bot 全成功
RoboTTT 79% 9 / 20 13 / 20 2 / 10
GDN 56% 3 / 20 8 / 20 0 / 10
GR00T N1.7 42% 3 / 20 3 / 20 0 / 10
GR00T N1.7 Hist. 0 / 20 8 / 20 0 / 10
  • 相对单步 baseline +87%(79 vs 42),相对最强 baseline GDN +41%。Gear Bot(5 分钟、十阶段)只有 RoboTTT 拿到过全成功
  • 质性优势三点:追踪任务进度(fast weights 化解视觉相似阶段的 state aliasing,baseline 会跳步);strategic recovery(钻头没对上螺丝就抬臂重对,baseline 装作成功继续下一阶段);细粒度阶段更精准(历史观测缓解当前遮挡下的 partial observability)。
  • 反面教材:naive 拼历史不可靠——GR00T Hist. 在 Pup Go Car 39.5% < 无历史 GR00T 的 57%(spurious correlation + 推理时时序 OOD)。GDN 与 RoboTTT 状态都是固定大小,差别只在更新规则:线性关联更新 vs 测试时梯度下降的非线性 fast model。

4.2 Context scaling 曲线(headline result)

Context scaling curve Figure 4:预训练 context 从 128 到 8K,RoboTTT 的闭环任务完成分稳定爬升、无饱和迹象;GDN 完全没有这个趋势。虚线为单步(GR00T)与短 context(GR00T Hist.)参照。

预训练 context RoboTTT 闭环完成分
1K 43.9%
8K 71.5%(+63% vs 1K;+57% vs 最强短 context baseline 45.6%)
  • 作者对 GDN 无 scaling 趋势的解释:TTT 的 \(W_0\) 与更新动态被外层损失 meta-learn,序列越长塑造它的更新步越多;GDN 的线性关联状态没有这种 meta-learning 通道。
  • 1K 以下 RoboTTT 变弱的归因很诚实:rollout 时长超过训练 context(1K ≈ 半分钟 < 最短任务),推理时 fast weights 更新远超训练窗口、RoPE 外推到未见位置。

4.3 One-shot 视频模仿与扰动鲁棒性

One-shot imitation rollout Figure 5:连续镜头——人类演示一个未见的电路配置(机器人静止旁观),场景重置后 RoboTTT 复现装配。所有配置共用同一个 prompt "assemble circuit",目标配置只能从 in-context 视频读出。

One-shot Circuit(未见配置) 完成分 全成功
RoboTTT 65% 6 / 10
GDN 33% 0 / 10

GDN 会抓错元件或装错顺序——能"编码"context 不等于能"使用"context;TTT 靠对历史做过梯度更新的 fast model 在需要时检索出演示配置。

扰动鲁棒性(Pup Go Car,人为拆掉已装的车顶/轮胎,30 分钟扰动数据与任务数据 co-train):

Method 车顶扰动恢复 轮胎扰动恢复
RoboTTT 15 / 20 18 / 20
GDN 13 / 20 18 / 20
GR00T N1.7 10 / 20 11 / 20
GR00T N1.7 Hist. 3 / 20 5 / 20

4.4 DAgger Distillation

100 条 DAgger 轨迹(RoboTTT 与 GR00T 各作 base policy 采 50 条),所有方法共用这批数据:

训练方式 平均提升
标准 DAgger(只 finetune 人类纠正) +9%(四方法平均);+13%(两个序列模型)
DAgger Distillation(失败作 context + 纠正作 target) +33% 平均:RoboTTT +36%,GDN +29%

关键对照:把 GR00T 在完整轨迹(含机器人失败动作)上微调 = 只用纠正微调(都是 57%)——次优动作作为模仿目标毫无价值,价值全在作为 context。GDN 也大涨说明 DD 是序列模型通用配方,但 RoboTTT 受益最大。

4.5 关键消融(Pup Go Car)

Configuration 结论
去掉 sequence action forcing 闭环性能大幅崩坏,动作不准、无法推进
Fast model 用线性层(TTT-Linear) 好于 GR00T 但比 MLP 差 27% —— 非线性 fast model 是关键
只有 state tokens 过 TTT 起点
+ action tokens 相对 +23%(感知自身过去动作 → 更好捕捉环境动力学)
+ register tokens(完整 RoboTTT) 再 +18%;同样的 register tokens 加给 GR00T 无效——只有配合 TTT 的时间建模才有用

5. 引申问题 / 讨论

5.1 做得好的地方

  1. "attention 管单步、TTT 管时间"的正交分解很干净:不动 VLA 原有的单步计算图,把时间维完全交给新插入的 TTT 层,加上 \(\tanh(\alpha)\) 零初始化 gating,使预训练 GR00T 的能力被无损保留、TTT 贡献从零渐进学入。这是"给现有 VLA 加长记忆"最低侵入性的方案,也解释了为什么能宣称 plug-and-play。
  2. 用 16 个 register token 做跨时间的 VL 信息载体是个聪明的开销折衷:VL token 数量大,直接过 TTT 层不可行;register token 在单步 attention 里吸收 VL 信息、再进 TTT 层跨时间传递。消融证明这不是白送容量——同样 token 加给 GR00T 无效,只有配 TTT 才有 +18%。
  3. DAgger Distillation 的不对称监督是全文最有想法的一笔:同一批 DAgger 数据,标准用法 +13%、DD +33%,而"失败动作作为模仿目标价值为零"(GR00T 全轨迹微调 = 纯纠正微调)这个对照把机制钉死了——增益完全来自"失败作为 context"。这是 Algorithm Distillation 第一次在真机上兑现成可测的 on-the-fly 改进。
  4. Context scaling 曲线配了一个内在机制解释:不是"越长越好"的黑盒经验,而是给出了 GDN 这个"同为固定大小状态、只差更新规则"的严格对照——scaling 增益来自梯度下降更新 + meta-learned \(W_0\)(序列越长、内层更新被外层损失塑造得越充分),线性关联状态没有这条通道所以曲线平坦。这比单纯报一条上升曲线的说服力强得多。
  5. Sequence action forcing 找准了 sequence diffusion 训练的坑:全序列共享噪声水平会让整条序列一致偏易/偏难,独立采样后训练才稳定——这是把 Diffusion Forcing 的 insight 落到 VLA 序列训练的一个必要工程发现,消融显示没有它整个方法不成立。
  6. 失败模式的自我披露诚实:短 context 变体变差的原因(rollout 超出训练窗口、RoPE 外推)、GR00T Hist. 反而更差的 spurious correlation 问题,都主动分析而非回避。

5.2 做得不够好的地方 / 值得质疑的地方

  1. "8K context"其实只是预训练;post-training 全部在 1K。所有任务的 post-train context 固定 1K(约半分钟),而 Gear Bot rollout 长达 5 分钟(30 Hz 下 ~9K timesteps)——推理时 fast weights 的更新步数远超 post-train 窗口。作者自己在解释 1K 预训练变体为何差时说"rollout 超出训练 context 会出问题",但完全相同的错配存在于他们自己的最终配置(1K post-train → 5 分钟 rollout),为什么这里就不是问题?"8K 预训练的收益如何穿过 1K post-train 存活下来"这个最有趣的机制问题一句没讲,也没有 post-train context 长度的消融。
  2. 没有 full-attention 长 context 对照。论文反复说 Transformer 推理开销随 context 增长所以不可行,但那是部署论证,不是科学对照——在 1K context 下训一个 full attention 序列 policy 完全可行(他们的 TBPTT 基建就能支持),它能给出"TTT 压缩相对无损 attention 丢了多少"的上界。现在唯一的序列 baseline 是 GDN,而 GDN 恰好是最有利于本文叙事的对照(线性、无梯度更新)。
  3. GR00T Hist. 这个"短 context baseline"只有 1 帧历史,接近稻草人。128/512 context 的 RoboTTT 变体自己就是更公平的短 context 参照,但主表(Table 1)没有它们,只在 scaling 图里出现。"比最强短 context baseline 高 57%"的对象是 +1 帧的 GR00T Hist.,这个数字的含金量要打折。
  4. 统计强度弱:每任务 20 trials(Gear Bot 10),无置信区间、无显著性检验。headline 之一"Gear Bot 唯一全成功"落在 2/10 上;扰动实验 15/20 vs 13/20(RoboTTT vs GDN)在 n=20 下两比例检验远不显著。rubric 分数是人为设计的 partial credit(如 Pup Go Car 的 0.05/0.1/0.25...),不同 rubric 设计会改变"87%"这类相对提升的大小。
  5. "without growing inference latency" 没有任何延迟数字。全文唯一的部署信息是 RTX 5090 + 30 Hz。TTT 层推理时每个 timestep 要做一次 fast-weight 梯度更新(两层 MLP 的 forward-backward × 16 层),这个额外开销相对 GR00T 是多少毫秒?与 GDN(无梯度更新)的推理开销差多少?一篇以"恒定推理开销"为核心卖点的论文没有一张 latency 表,是明显的缺失。
  6. One-shot 模仿的泛化范围比宣传窄:80 个配置全部由同一组 8 种电路元件的组合与顺序构成,训 20 测 60 是封闭元件集内的组合泛化,不是新任务、新物体、新场景;且训练时每个配置配了 5–20 条人类视频(相同镜头、机器人静止旁观的规范化视频),测试视频也是同分布采集。离"看一遍 YouTube 就会"的叙事还有相当距离。
  7. 扰动鲁棒性不是长 context 的涌现能力:需要专门采 30 分钟扰动数据 co-train,且所有 baseline(含单步 GR00T)都因此获得了不小的鲁棒性(10/20、11/20)。长 context 的净贡献是 15/20 vs 10/20 这个量级,正文的表述比数字更响亮。
  8. GDN baseline 的公平性存疑:参数量与层位置对齐了,但 GDN 的初始状态是否也 meta-learn 了?"线性关联状态 admits no such meta-learning"这句话在机制上并不严格——GDN 的初始状态与衰减参数同样可以端到端学习,作者没有说明是否给了 GDN 同等的优化待遇(以及是否为 GDN 单独调过超参)。
  9. 训练成本高但被轻描淡写:8K context 下 global batch 只有 16,16× GB200 跑 30K 步;TBPTT 的 segment 长度这个关键超参全文没报,不同 segment 长度对性能的影响(梯度截断带来的偏差)没有消融。conclusion 承认训练贵、建议未来用 TNT,但没给出任何 GPU-hours 数字供别人评估复现成本。
  10. Context scaling 图与主表的评测协议不一致:scaling 图注明"预 DAgger 训练"(Pup Go Car 主结果用了 DAgger 数据),即 71.5% @8K 与主表 79% 不在同一协议下,读者容易把两处数字混着引用;摘要说 +62%、intro 说 +63%(71.5/43.9 ≈ 1.63),细节打磨也有毛边。

5.3 值得继续探讨的方向

  • Post-train context 消融:8K post-train(而非 1K)会不会进一步涨?如果 1K post-train 就够,说明长 context 的收益主要在预训练学到的"压缩先验"而非任务级长依赖——这两种解释对后续工作方向完全不同。
  • 与 full attention 的容量对标:在 512–1K context 下做 TTT vs full attention vs GDN 三方对照,量化 fast-weight 压缩的信息损失。
  • 更强的内层优化器:作者自己点名 Muon(TTT-Muon 已在语言/视觉上验证);内层从单步 GD 换成带动量/正交化的更新,可能改变 scaling 曲线斜率。
  • Robotics-oriented TTT 目标:现在内层损失是通用的 K→V 重建 MSE;换成 inverse/forward dynamics、contact 预测等机器人自监督目标(类比 vision 领域给 ViT-TTT 换目标的工作)。
  • DAgger Distillation 与 RL 的衔接:DD 学的是"人类纠错分布",RL 直接优化任务成功率;DD 的 fast-weight 适应能否作为 RL 的 warm start / exploration prior,是 conclusion 里"combine with RL"最具体的落点。
  • 1M context 的路障是什么:Jim Fan 的宣传说"1M context 不是幻想",但 8K 时 global batch 已经只剩 16——继续 scale 的瓶颈在训练吞吐而非机制,TNT 式并行 TTT 训练是否足够?
  • 跨 episode 记忆:现在每个 rollout 从 \(W_0\) 重置;fast weights 跨 episode 持续(真正的 lifelong deployment learning)会不会灾难性漂移?需要什么样的 forgetting 机制?
  • 与语义记忆的混合:MEM/BPP 的 language memory 与 RoboTTT 的稠密 visuomotor fast weights 是互补的两层——高层"菜谱进度"用语义、低层"刚才那下没拧紧"用 fast weights,混合架构值得一试。

参考资源

  • 论文 PDF: paper.pdf
  • LaTeX 源码: source/
  • 项目主页: research.nvidia.com/labs/gear/robottt
  • 关键 baseline / 相关论文:
  • GR00T N1.7 (nvidia2025gr00t) — backbone 与单步 baseline
  • Gated DeltaNet (Yang et al. 2024) — 线性递归记忆对照
  • TTT: Learning to (Learn at Test Time) (Sun et al. 2024)、TTT-MLP/Muon (Zhang et al. 2025)、TNT (Li et al. 2025,高效 TTT 训练)
  • Algorithm Distillation (Laskin et al., ICLR 2023) — DAgger Distillation 的思想源头
  • DAgger (Ross et al. 2011)
  • Diffusion Forcing (Chen et al. 2024) — sequence action forcing 的呼应
  • ViTA (Ziakas et al. 2026) — 最接近的 TTT-for-robotics 先行者(value function 而非 policy)
  • π₀.₆-MEM (2603.03596) — 语义外部记忆的对照路线(见本库笔记)