跳转至

GenCeption: Video Generation Models are General-Purpose Vision Learners

论文阅读笔记 — 用于后续讨论的概览


1. 基础信息

  • 题目: Video Generation Models are General-Purpose Vision Learners
  • 作者: Letian Wang¹² (一作), Chuhan Zhang¹, Rishabh Kabra¹³, Jasper Uijlings¹, Steven Waslander², Andrew Zisserman¹⁴, Joao Carreira¹, Kaiming He¹⁵, Misha Andriluka¹, Eduard Gabriel Bazavan¹, Andrei Zanfir¹, Cristian Sminchisescu¹⁶ (通讯) — ¹Google DeepMind / ²University of Toronto / ³UCL / ⁴Oxford / ⁵MIT / ⁶Lund University。作者阵容相当豪华:Zisserman、Carreira(Kinetics/I3D)、Kaiming He 同列,核心执行团队(Wang / Zanfir / Bazavan / Andriluka / Sminchisescu)正是前作 THFM 的原班人马
  • arXiv 编号: 2607.09024(2026-07 提交,Google DeepMind 技术报告模板)
  • 项目主页: https://genception.github.io
  • 关键词: video diffusion pre-training, unified perception model, feed-forward (single-step) inference, WAN 2.1, Rectified Flow, synthetic data, sim-to-real, raymap, referring segmentation, 3D keypoints

GenCeption capabilities teaser Figure 1:一个模型、一次前向、多种模态 — normal / depth / 前景软分割 / DensePose / 2D+3D keypoints 全部由同一 checkpoint 输出。注意第 3、4 行:训练数据只有 synthetic human,但 gorilla 与 humanoid robot 照样能跑 — 这是全文"预训练先验干活"论点最直观的证据。

2. 文章介绍

2.1 解决的领域和问题

属于视觉基础模型 / 表征学习领域,回答的问题是:NLP 靠 next-token prediction 从"每个任务一个模型"收敛到"一个 generalist 基础模型",计算机视觉的等价 pre-training objective 是什么

当前 CV 仍处在"specialist 阶段":SAM 系列管分割、DepthAnything 系列管几何、Sapiens/GVHMR 管人体 — 每个都要定制架构、解码器与损失函数。论文主张 大规模 text-to-video 生成就是那个统一预训练范式,并给出一个具体架构 GenCeption:把预训练视频 diffusion backbone(WAN 2.1)改造成单步 feed-forward 感知模型,用 text prompt 在深度、法线、分割、相机位姿、2D/3D 关键点等任务间切换。

2.2 Motivation

论文提出通用视觉预训练目标应满足三条判据,并论证 text-to-video 生成是唯一同时满足三条的范式:

  1. Spatio-Temporal Evolution:世界是 4D 连续体,生成高保真视频迫使模型内化 3D 几何、物体恒存性与物理规律 — 对比 image-level 预训练(CLIP/DINO/MAE)天然缺时序;
  2. Vision-Language Alignment:text-to-video 模型原生以文本为条件,语言对齐是预训练自带的 — 对比 vision-only SSL(VideoMAE/V-JEPA)完全没有语言接口;
  3. Scaled up:视频生成因标注成本低 + 商业价值高,已经被工业界用海量数据和算力 scale 起来了 — 对比 video SSL 模型至今停留在 ~1B 参数量级。

换句话说:别再自己设计视觉预训练目标了,视频生成公司已经替你把预训练做完了,缺的只是一个把生成模型转成感知模型的 post-training 配方 — 这正是本文提供的东西。

2.3 之前工作的问题

类别 代表工作 缺陷
Task-specific 感知基础模型 SAM 1–3, DepthAnything 1–3, Sapiens, GVHMR/TRAM/Genmo 每个任务定制架构 / decoder / loss,无法向任务谱系扩展
Image-domain 统一模型 4M, DAViD, Diception 无时序理解;多任务仍靠 task-specific encoder/decoder/loss(DAViD 尤甚)
Video 统一尝试 Uni-Perceiver 系, UnityVideo 广谱评测下效果远不及各任务 specialist
Vision-only SSL MAE / VideoMAE V2 / RVM, DINO v1–v3, V-JEPA 无 vision-language 对齐;video 表征模型比 LLM 小几个数量级
对比学习 CLIP, SigLIP 图像级语义对齐强,但 video-level 多模态表征仍是未解问题
Image diffusion 重用 Marigold, E2E-FT, GenPercept, Diception 单帧模型,视频上时序不一致
Video diffusion 重用(单任务) DepthCrafter, NormalCrafter, Geo4D, DiffusionRenderer, ReferEverything, BufferAnytime 一次只解决一个(通常 dense)任务;多步采样慢
Training-free prompting(concurrent) Wiedemer et al.(Veo 3 "zero-shot learners") 多步生成推理慢,验证以定性为主
Image-space 通才(concurrent) Vision Banana(gabeur2026image) 停留在 2D image space,天然无时序一致性

2.4 论文解决方案(一句话)

把开源 WAN 2.1 text-to-video diffusion 改造成单步 feed-forward、text-prompt 切换任务的统一视频感知模型:dense 任务全部压进 3 通道 RGB 空间(相机位姿用 "Rothko" raymap 排版)、sparse 任务用逐帧 learnable token + MLP,纯 L2 一个损失、主要用 7.5K 条合成人体视频 post-training,在 depth / normal / 相机位姿 / 前景与 referring 分割 / 3D keypoint 上匹配或超越各任务 SOTA specialist,且 fine-tuning 数据比 D4RT / VGGT-Ω 少 7×–500×。

2.5 与前序工作的关系

  • THFM(wang2026thfm, arXiv 2603.25892):同团队直接前作,"unified video foundation model for 4D human perception"。本文是它从 human-centric 到 general-purpose 的推广,加了更广的任务/基准与行为分析 — 论文明确承认这层关系;
  • WAN 2.1(arXiv 2503.20314):backbone 来源,开源开权重(1.3B / 14B 两档),这让整个配方对社区可复现 — 与用内部 Veo 的 Wiedemer et al. 形成有趣分工;
  • Wiedemer et al. "Video models are zero-shot learners and reasoners"(2509.20328):concurrent,同一 hypothesis 的 training-free 验证(对 Veo 3 做多步生成式 prompting,以定性为主)。本文的自我定位很准确:"如果他们证明了先验的存在,我们提供高效收割先验的架构";
  • Vision Banana(gabeur2026image, 2604.20329):"Image generators are generalist vision learners",concurrent 的 image-space 版本;本文的 depth log-mapping 直接借自它。差异是 video-native + feed-forward;
  • Diception(zhao2025diception):text-prompt 切换任务的 image diffusion 通才,是本文最近的 image-domain 前驱,也进了对比表(被全面碾压);
  • 借用组件:raymap 表示来自 Cameras-as-Rays / DiffusionSfM / Geo4D;temporal 位置外推用 Position Interpolation;评测协议沿用 Sapiens / DAViD(Hi4D, Goliath)与 VoCap(Ref-DAVIS, MeViS);
  • 源码考古:preamble 定义了从未使用的 \veo / \veotwo / \veothree / \geminipro(Gemini 2.5 Pro)/ \nanobanana 宏(grep 验证正文零调用)—— 暗示这条线存在(过)基于 Veo/Gemini 的内部版本,WAN 2.1 是发表用的开源载体,报出的数字可能低估范式上限;被注释的致谢名单(Thabo Beeler、Erroll Wood、Sergio Orts Escolano 等 Google digital human 班底)印证合成人体管线是自家家底延续。详见讨论笔记 §2.6。

3. 方法介绍

GenCeption architecture Figure 2:架构总览。VAE encoder/decoder 与 text encoder 全部冻结(雪花),只训练 DiT(火焰)。Dense 任务:输入视频 clean latent + 文本任务指令 → DiT 单次前向 → VAE decoder 解码出"目标模态视频"。Sparse 任务:追加逐帧 learnable token,经 DiT 后由小 MLP 解码坐标。所有任务共享同一 backbone、decoder 与损失。

3.1 从多步生成到单步感知(Feedforward Perception Formulation)

WAN 2.1 的组件:VAE encoder-decoder(时间 4×、空间 8× 压缩)、text encoder(~10GB)、latent DiT。原始 DiT 以 Rectified Flow 目标训练,从高斯噪声出发迭代去噪,预测速度 \(v = \epsilon - x_0\)

GenCeption 的重构只动输入输出约定、完全不动架构:

  1. 喂 clean latent:不加噪声,直接把输入视频的干净 latent \(x_0\) 喂给 DiT;
  2. 固定 \(t=0\):conditioning timestep 设为 Rectified Flow 过程的终点,向模型声明"输入是无噪的";
  3. 取负号:DiT 在 RF 目标下输出 \(v = \epsilon - x_0\),取 \(-v = x_0 - \epsilon\) 后再进损失/decoder — 这个量在分布上更接近目标视频的 latent,实验上显著加速收敛并提升性能;
  4. 只用最后一层特征:不像常见的 "diffusion feature extraction" 工作去挖中间层,最后一层输出天然对齐 VAE decoder 的输入空间,decoder 零修改直接复用。

一句话理解:不是把 DiT 当通用 encoder 挖特征,而是让感知任务"长得像生成过程的最后一步",从而最大限度贴合预训练形态(论文的设计第一原则:maximize compliance with the original pre-training regime)。

3.2 Dense 任务统一进 RGB 空间

所有 dense 任务输出都表示成 \([0,1]\) 的 3 通道 RGB"视频",共享同一 backbone + decoder + 权重,任务只靠 text prompt 切换:

  • 单通道任务(depth、前景分割、referring 分割):三通道复制;
  • 天然三通道任务(surface normal、DensePose):直接映射;
  • 高维任务(相机位姿):传统上是矩阵/6 通道 raymap(ray origin 3 + ray direction 3),本文提出 "Rothko" raymap — 在空间上排版:画面中央矩形放 ray origins(translation),外围放 ray directions(rotation),把 6 通道塞进 3 通道,保住单 decoder 架构不动。

Rothko raymap Figure 3:Rothko raymap — rotation raymap 铺满背景、translation raymap 缩成中央色块,像 Mark Rothko 的色域绘画。这是"任务定制下沉到数据格式"哲学的最极端案例:连相机外参都被排版成了一张 RGB 图。

论文把这层设计哲学讲得很直白:如同 LLM 把一切任务重写成文本字符串,视觉任务应该被投影进连续像素空间 — 预训练视觉先验的原生领地。加新任务不再改架构和训练配方,只改数据格式。

3.3 Sparse 任务:learnable token + MLP

机器人控制等下游需要可直接使用的结构化输出(显式坐标)。做法:

  • 给视频 latent 追加 \(T\) 个 learnable token(每视频帧一个),过 DiT 后每个 token 经 MLP 解码为该帧的 \(K\) 维目标(2D/3D keypoints);
  • 为维持与 base model 的兼容性,对新增 token 施加原生 3D RoPE:空间位置未知 → 设为可学习;时间位置因帧数 \(T\) 被 VAE 压到 \(T'\),用 Position Interpolation 把帧索引缩放回预训练见过的时间范围内;
  • 消融显示这种 additional-query 方案优于加额外 attention 层。

3.4 可扩展合成数据生成

真实数据集很少同时带 7 种模态的 GT,于是主训练数据完全合成:

  • 800 个 RenderPeople 人体资产 × 200 条 CMU mocap 动作,配 3D 场景 / HDRI 背景,变化焦距、机位与轨迹 → 7,500 条视频
  • Blender 分 render pass 输出 normal / depth / segmentation mask;rigged 资产直接给出 2D/3D 关节 GT;
  • 补充公开合成数据:TartanAir、Virtual KITTI、MVS Synth(深度 + 相机轨迹);
  • 唯一例外:referring 分割用真实数据(MeViS、Ref-COCO、YouTube-VOS);
  • 离线预处理:video latent 与 text embedding 全部预计算缓存。

3.5 训练配方:纯 L2 + 任务定制下沉到数据

多任务学习的传统痛点是每个任务一套专用 loss + 手工平衡权重。本文只用一个标准 L2 loss(dense 在 latent 空间、sparse 在输出空间),把任务特异性全部移到数据表示层:

  • 深度的 scale ambiguity 传统上需要 scale-invariant loss,这里直接在数据层解决:每条视频用场景中位数深度归一化,再经非线性映射 \(d' = \text{clip}(\alpha \log(d+1), 0, 1)\) 压进 RGB 值域(\(\alpha\) 调节近场细节 vs 远场结构的分辨率分配,借自 Vision Banana);
  • 任务间平衡只靠 data mixture ratio — 与 LLM 的实践完全同构。

3.6 Implementation Details 与推理成本

  • 训练:480×832、81 帧 @ 24 FPS;batch 64、256 块 v6e TPU;Adam lr 5e-5、15,000 步、250 步线性 warmup;gradient clipping + gradient dropping(梯度范数超过高阈值的整个 batch 直接丢弃)— 作者强调这两项对稳定性 vital;
  • 推理(单块 v6e TPU,81 帧 480×832 一段):
模型 总耗时 等效吞吐 其中 DiT VRAM
WAN 2.1 1.3B 5.92 s 13.6 FPS 0.96 s 15.3 GB
WAN 2.1 14B 10.03 s 8.0 FPS 5.11 s 42.8 GB

两者共享 10 GB text encoder + 0.25 GB VAE(可 offload 到内存换 VRAM)。对比标准 WAN 的 50 步采样,单步化带来 ~50× 的 DiT 计算节省。

4. 结果对比

SOTA radar + data efficiency Figure 4:左 — 单模型(虚线 Generalist / 实线 Specialist)在 10 个任务-基准组合上全面接近或超过各任务 SOTA specialist。右 — depth 任务的数据效率散点:WAN 14B 用 1.23M 帧达到 D4RT(86M 帧)/ VGGT-Ω(600M 帧)级别的 AbsRel。注意纵轴断裂:V-JEPA 同数据微调差出一个档次。

4.1 主结果:对阵各任务 specialist

训练不用任何评测基准的配套训练集;除 referring 分割外全部合成数据。摘录 Table 1 关键列(粗体 = 全表最佳):

几何类(normal mAE↓ / depth AbsRel↓ / camera pose↓)

方法 Backbone Normal Sintel Normal Hi4D Depth Sintel Depth KITTI Depth ETH3D Depth Goliath ATE Sintel RPE-T RPE-R
Marigold-E2E-FT SD V2 0.86B 33.5
NormalCrafter SVD 1.5B 30.7
Lotus-2 FLUX 12B 30.3
Sapiens 2B 12.14 0.033
DAViD-Large ViT-L 0.34B 15.37 0.012
DepthAnything 3 DINOv2 1.15B 0.201 0.059 0.028 0.065 0.048 0.456
D4RT VideoMAE2 1B 0.148 0.051 0.065 0.024 0.126
VGGT-Ω DINOv3 1B 0.145 0.041 0.016 0.057 0.059 0.407
Diception (generalist) SD3 2B 37.9 20.4 0.500 0.145 0.177
Ours Specialist-L WAN 14B 29.7 10.99 0.130 0.048 0.037 0.008 0.050 0.018 0.464
Ours Generalist-L WAN 14B 29.3 11.47 0.156 0.048 0.044 0.011 0.062 0.018 0.485

分割与 3D 人体(MSE↓ / J&F↑ / MPJPE↓)

方法 VideoMatte PhotoMatte Ref-DAVIS MeViS EMDB
RVM (MobileNetV3) 0.0010
DAViD-Large 0.0009
VISA (Chat-UniVi 13B) 70.4 44.5
VoCap (SAM2 0.4B) 75.1 51.9
ReferEverything (WAN 14B) 75.0 60.3
SAM 3 41.3 38.3
SAM 3 + Gemini 3.5 Flash 64.5 57.5
GVHMR 72.6
Genmo 73.0
Ours Specialist-L 0.0027 0.0009 76.4 70.0 71.8
Ours Generalist-L 0.0010 0.0008 75.8 69.0 ~

亮点与暗点并存:Hi4D normal(10.99 vs Sapiens 12.14)、Goliath depth(0.008,Sapiens 的 1/4 误差)、MeViS(70.0 vs ReferEverything 60.3,+9.7)优势显著;EMDB 以 71.8 险胜所有 3D 人体位姿 specialist 且不需要 person detection / 2D keypoint 预处理;但 KITTI / ETH3D / RPE-R 实际输给 VGGT-Ω 或 D4RT(详见 §5.2)。

4.2 预训练范式对比 + 数据效率

同样的微调数据(7.5K 合成视频 / 0.9M 帧)下换 backbone(Table 2,depth 三基准平均):

Backbone 参数 Avg AbsRel↓ Avg δ₁↑
V-JEPA-H 0.6B 0.281 52.2
VideoMAE V2-H 0.6B 0.175 62.0
VideoMAE V2-G 1B 0.154 66.9
WAN 2.1-S(生成式) 1.3B 0.122 85.8
WAN 2.1-L(生成式) 14B 0.093 90.7

1.3B 的 WAN 大幅超过 1B 的 VideoMAE V2-G(δ₁ 85.8 vs 66.9,+18.9),且 VideoMAE/V-JEPA 天然不支持 text-prompt 多任务。从零初始化 DiT 训练则几乎是平的学习曲线(Figure: pretrained weight transfer)— 预训练先验是收敛的必要条件。

与领先几何模型对数据量的比较(加入 TartanAir/VKITTI/MVS Synth 后 8.08K 视频 / 1.23M 帧):

方法 数据集数 视频数 帧数 Avg AbsRel↓ Avg δ₁↑
DepthAnything 3-G 22+ 1.23M ~200M 0.096 89.1
D4RT 11+ ~1M ~86M 0.082 91.7
VGGT-Ω 33+ ~3M ~600M 0.067 95.2
Ours WAN-L 4 8.08K 1.23M 0.071 93.8

1.23M 帧 vs 86M–600M 帧 — 按帧数算是 70×–490× 的微调数据缩减,性能落在 D4RT 与 VGGT-Ω 之间(论文口径 "7× to 500×")。

4.3 关键消融

  • Joint vs specialist:混合结果 — 前景分割受益于联合训练(VideoMatte 0.0027→0.0010)、referring 分割基本不变、depth/camera pose 普遍退步(Sintel 0.130→0.156)、3D keypoint 被严重摧毁(Generalist 直接没有 EMDB 数字)。作者归因:(1) 显式坐标回归偏离连续像素空间预训练;(2) 从零初始化的 learnable token 扰乱预训练 DiT 的 attention 结构。结论被提炼成 post-training 教训:"对预训练 backbone 做最小架构修改,否则重新设计预训练";
  • Layer transfer:迁移预训练层数越多性能越好,全随机初始化学习曲线几乎平的;
  • Scaling:1.3B→14B、0.9M→1.23M 帧均单调提升(两个点的"preliminary scaling property")。

4.4 涌现行为(Emergent Behaviors)

OOD generalization to animals Figure 5:只在 synthetic human 视频上训过的模型,对真实世界的猫 / 猴 / 狮 / 河马照样输出 normal、depth、分割乃至 3D 骨架。作者特别指出输出细节(猫须、发丝软分割)超过 Blender 训练数据本身的质量上限 — 细节只可能来自视频生成预训练的先验。

  • Sim-to-real:纯合成训练 → 真实视频 SOTA 级表现,输出的细粒度(whiskers、头发软边)超过训练数据的渲染质量
  • 多实例泛化:训练每条视频只有一个人,zero-shot 处理真实多人场景;
  • OOD 类别泛化:只训过人,泛化到动物、拟人角色、人形机器人。

5. 引申问题 / 讨论

5.1 做得好的地方

  1. Feed-forward 重构与预训练形态的精确对齐:clean latent + \(t=0\) + 取负速度 \(-v = x_0 - \epsilon\) 这套组合不是随意的 —— 它让"感知"恰好落在 Rectified Flow 生成过程的终点形态上,最后一层特征因此天然对齐 VAE decoder,实现零架构修改。对比同类工作从中间层挖特征再训新 decoder 的做法,这是全文最优雅的一步,也解释了为什么它能最大保留预训练先验;
  2. 任务特异性从 loss/架构下沉到数据表示,贯彻得最彻底:纯 L2 一个损失、任务平衡只靠 mixture ratio、深度的 scale ambiguity 用 median 归一化 + log mapping 在数据层解决 — 这是把 LLM "任务进数据、不进架构"哲学搬到视觉的最完整实例(DAViD/Sapiens 还在 per-task head,Diception 还在 image space)。Rothko raymap 是这个哲学的极端案例:连 6 通道相机外参都被排版成一张 RGB 图;
  3. 评测纪律:不用任何评测基准的配套训练集,除 ref-seg 外全合成训练 — 这让所有数字都是 zero-shot / sim-to-real 口径,claim 的可信度比"在 22+ 数据集上训过再评"的对手高一档;
  4. Same-finetuning-data 的 backbone 对照:V-JEPA / VideoMAE V2 用同样的 7.5K 视频微调再比较,把"backbone 预训练目标"这个变量从微调数据里剥离出来 — 大多数"我们的预训练更好"论文连这一步都不做;
  5. 诚实报告负结果并提炼教训:joint training 摧毁 3D keypoint 这个结果没有被藏起来,还给出机制解释(新 token 扰乱预训练 attention)和普适建议(post-training 应最小化架构修改)。这条教训对整个 "repurpose 大模型" 领域都有参考价值;
  6. 推理成本透明:总耗时 / DiT 占比 / VRAM / 可 offload 组件全部给出,且明确单步化相对 50 步采样的收益 — 相比很多 diffusion-repurposing 论文对延迟避而不谈,值得肯定。

5.2 做得不够好的地方 / 值得质疑的地方

  1. "7×–500× 数据效率"的会计口径只算 post-training:WAN 2.1 生成式预训练吞掉的海量视频与算力被整体移出账本。对手 VGGT-Ω 的 DINOv3 预训练同样不计入,但两边预训练的规模差距(工业级视频生成 vs 1.7B 图像 SSL)远大于微调数据的差距;且 WAN-L 是 14B、对手是 ~1B — 参数大 14×、预训练重几个量级,换来微调数据少 70×–490×,这是一笔"重预训练 + 轻微调"的交易而非无条件的效率提升。另外下限 "7×" 从论文任何表格数字都复原不出来(帧数口径是 70×–490×,视频数口径是 124×–371×);
  2. Pretraining 对比的归因没有表面上干净:V-JEPA / VideoMAE V2 的预训练数据(~2M 视频量级)与 WAN 2.1 的预训练数据差几个数量级,"generative diffusion objective itself is essential" 与 "WAN 见过多得多的数据" 两个解释无法区分。正文用了 "suggestive evidence" 的谨慎措辞,但 abstract 直接写成 "the video generative pretrained backbone outperforms alternative pretraining paradigms under comparable settings" — comparable 的只有微调数据,预训练完全不 comparable。缺一个 same-finetuning-data 的 DINOv2/v3 对照(DA3/VGGT-Ω 的 backbone 来源),而这本来是最有信息量的对照;
  3. "SOTA across all benchmarks" 与自家表格矛盾:Emergent Behaviors 一节写 "our model establishes new state-of-the-art performance across all benchmarks",但 Table 1 里 KITTI(0.048 vs VGGT-Ω 0.041)、ETH3D(0.037 vs 0.016,差 2.3×)、RPE-R(0.464 vs D4RT 0.126,差 3.7×)都是输的;Table 2 平均 AbsRel 0.071 也仍居 VGGT-Ω 0.067 之后。radar 图的 "SOTA 观感" 主要靠 Sintel / Goliath / Hi4D / MeViS / EMDB 撑起。RPE-R 差 3.7× 这个显著弱点正文一个字都没讨论(见 §5.3 的猜想);
  4. Generalist 的统一性在最结构化的任务上不成立:headline 是 "单一 task-agnostic 模型",但 Generalist-L 在 EMDB 上没有数字(训练被 "severely degrades"),实际可用的 3D keypoint 结果全部来自 Specialist。Depth Sintel 也从 0.130 退到 0.156(+20% 误差)。诚实的总结应该是:RGB 空间内的 dense 任务可以统一,跨出像素空间的任务(坐标回归)统一失败 — 这恰恰说明 "任务=数据格式" 哲学有一条硬边界,论文把它写成 ablation 而没有反映到 framing 里;
  5. 吞吐口径对 specialist 不利也对自己有利,且瓶颈解剖后不在 DiT:5.92s/10.03s 是 81 帧整段 offline 处理,需要完整视频输入,无 streaming/causal 模式;与 DA3/VGGT 类 per-frame / per-set 模型的延迟不可直接换算,对机器人控制(论文自己在 §3.3 提的动机)延迟与非因果形态都不可用。拆开看:1.3B 的 DiT 只占 0.96s/5.92s(16%)、14B 占 51%,两个尺寸的非 DiT 开销恒定 ~4.95s(VAE + text encoding)—— 再提速要动的是 VAE 而非 DiT;且除 ref-seg 外任务 prompt 是固定小集合,text embedding 离线缓存即可去掉 10GB text encoder(训练时他们本来就这么缓存,推理侧却只提 offload 不提缓存);
  6. 深度输出是 per-video scale-free 的:median 归一化 + log mapping 意味着只能出相对深度,\(\alpha\) 的近远场权衡没有消融;AbsRel 评测本身做 scale 对齐所以基准数字不受影响,但 metric 需求(导航/AR/机器人)需要额外机制,论文未讨论;
  7. Referring 分割破坏了合成数据叙事,且 MeViS 的 headline 赢面不是 zero-shot:唯一用真实数据的任务恰好是语言 grounding 最重的任务 — 说明纯合成管线造不出语言-视觉对齐监督。更尖锐的是:正文声明 "trained without using any of the training sets provided alongside the evaluation benchmarks",但训练数据明确含 MeViS(train)、评测又报 MeViS(val)— 而 MeViS 70.0 vs ReferEverything 60.3 恰是全表最大赢面。按 ref-VOS 社区惯例同协议公平(对手也在 MeViS train 上训过),但"全表 zero-shot"的光环覆盖不到最大亮点,这句声明严格说自相矛盾(Ref-DAVIS 76.4 是真 zero-shot)。另外 SAM 3 的 41.3 J&F 是拿 concept-prompt 模型硬跑长句 referring 的结果(SAM 3 设计上不吃复杂指代表达),加了 Gemini agent 也只是部分修复 — 用它反衬 "our stronger ability in understanding complex sentences" 有挑软柿子之嫌;
  8. OOD "emergent" 的功劳归属被模糊化:对动物/机器人的泛化,机制上几乎必然来自 WAN 预训练见过这些类别的海量视频,而非本文的 post-training 配方 — 作者在正文其实也是这么解释的,但 abstract 的 "trained exclusively on synthetic human videos generalizes to animals" 把预训练贴现掉了。与第 1 条同根源:需要讲效率时预训练不算自己的成本,需要讲泛化时预训练又是自己的功劳
  9. 训练配置的过拟合风险没有披露:15,000 步 × batch 64 ≈ 96 万样本次,对 8.08K 视频约 119 个 epoch;没有 validation 曲线、没有 early-stop 依据,gradient dropping 的阈值也未给出。Zero-shot 评测结果好说明泛化没崩,但"多训会不会更好/已经过拟合到什么程度"完全是黑箱;
  10. 成文粗糙,关键细节缺失:正文 typo 不少("Methdology"、"diver trends"、"Qualatatively");Table 1 脚注定义了 "*"(same data trained baseline)但表内没有任何星号;camera pose 在正文归为 dense(raymap)而架构图又把它画进 sparse 输出 — ATE/RPE 究竟从 raymap 拟合还是 sparse token 直接回归,以及 raymap→pose 的恢复算法,全文没有说明;gradient dropping 被称为 "vital" 但阈值未给。对一篇 12 人署名的 DeepMind 报告来说,这些痕迹暗示赶工(很可能在抢 concurrent work 的时间窗);
  11. 三大方法支柱里有一根零消融:生成式预训练有 backbone 对比 + layer-transfer 消融、统一表示有 joint-vs-specialist 消融,而 feed-forward 重构什么都没有 — 全文没有"同模型同数据下单步 vs 多步采样"的对照,negate 的收益也只有一句 "empirically accelerates"。单步不掉点这个前提实际靠引用 E2E-FT 在图像深度上的结论隐式背书,在视频、在他们自己的 setup 下从未验证;
  12. VAE round-trip oracle 缺失,表示天花板未测量:监督在 latent 空间做、decoder 冻结 — 输出精度被"WAN VAE 能多忠实编码/重建一张 modality 图"锁死(8× 空间压缩、为感知质量而非数值精度设计)。最该有而没有的一行实验:把 GT depth 视频过一遍 VAE encode→decode 再算 AbsRel,直接量出表示本身烧掉的精度预算(也能检验第 3 条的 RPE-R 假说)。任何复现工作应第一个补这个数;
  13. 任务覆盖有水分:DensePose 与 2D keypoints 训了、teaser 里展示了、全文零定量评测;有定量评测的 6 个任务族里 3 个是 human-specific 基准(Hi4D/Goliath/EMDB,THFM 底色);无 detection / tracking / VQA — "general-purpose vision" 的实际考纲是"稠密几何 + 人体 + matting + ref-seg",与 LLM 的任务广度不在一个量级。

5.3 值得继续探讨的方向

  • RPE-R 差 3.7× 的根因:raymap 排版把 ray directions(决定旋转)放在画面外围,而 VAE 对边缘区域的重建质量通常更差;换排版(direction 放中央)或用 sparse token 回归旋转,能否修复?这是一个能直接检验 "Rothko 排版是否有信息代价" 的实验;
  • "任务=数据格式" 的扩展性压力测试:optical flow(2 通道,天然可视化为 RGB)、point tracking、语义分割(类别→颜色编码)都能塞进 RGB 空间;什么任务塞不进去(检测框?计数?VQA?)— 这条边界决定了该范式相对 VLM 的最终定位;
  • 用 pixel-space 表示救 3D keypoint:论文自己的教训是"最小架构修改",那么放弃 learnable token、把 keypoint 渲染成 heatmap 视频(Sapiens/DAViD 式)再统一进 RGB 空间,generalist 的退化是否消失?这是全文遗留的最明显的未做实验;
  • Read-only mask 版 learnable token:joint training 崩溃的机制是从零初始化的 query 被视频 token 回读、污染主干表征 — Octo 的 readout token 用 block-wise mask 做成"被动只读"恰好预防了这一点。给 DiT 的新增 token 加单向 mask(query 读视频、视频不读 query),能否在不放弃坐标输出的前提下救回 generalist?;
  • 因果化/流式化:蒸馏到 causal attention 学生模型或 chunked streaming 推理,才能兑现 robotics 动机;WAN 系已有 causal 变体生态(如 Self-Forcing 系列)可直接嫁接;
  • 部署侧的白捡优化:固定任务 prompt 的 text embedding 离线缓存(去掉 10GB text encoder,仅 ref-seg 保留)+ 蒸馏轻量 VAE decoder — 延迟解剖显示瓶颈在 VAE 而非 DiT(§5.2.5),这两步比动 DiT 划算得多;
  • 正式的 scaling law:现在只有 2 个模型点(1.3B/14B)× 2 个数据点;用 Veo 级 backbone 或 10×–100× 合成数据画出真正的曲线,才能支撑 "foundational path toward generalist vision intelligence" 的宏大结论;
  • 与 Vision Banana 的受控对比:同任务同微调数据下 image-space vs video-native 的差距到底多大?这是验证 "时序先验是关键成分" 的直接实验,目前两篇 concurrent 各说各话;
  • Metric depth:text prompt 里注入相机内参/场景类别先验,或加一个 scale token,把 scale-free 输出升级成 metric 输出;
  • 语言接口的深度利用:目前 text 只是 8 选 1 的任务选择器(ref-seg 除外);组合式指令("左边那个人的深度")、链式任务、开放词汇 dense prediction 能否 zero-shot 涌现,是检验 "继承 LLM 指令遵循能力" 声明的试金石。

参考资源

  • 论文 PDF: paper.pdf
  • LaTeX 源码: source/
  • 讨论笔记: GenCeption_discussion.md — negate 的期望推导、Rothko raymap 拆解、learnable token vs Octo readout 对照、Specialist/Generalist 口径、源码考古(未使用的 Veo/Gemini 宏)与延迟解剖
  • 项目主页: https://genception.github.io
  • 关键相关论文:
    • THFM(同团队前作, arXiv 2603.25892)
    • WAN 2.1(backbone, arXiv 2503.20314)
    • Wiedemer et al., "Video models are zero-shot learners and reasoners"(concurrent, arXiv 2509.20328)
    • Vision Banana / "Image generators are generalist vision learners"(concurrent, arXiv 2604.20329)
    • Diception(arXiv 2502.17157 系, image-space 通才前驱)
    • D4RT(arXiv 2512.08924)/ VGGT-Ω(arXiv 2605.15195)/ DepthAnything 3
    • SAM 3(arXiv 2511.16719)/ VoCap(arXiv 2508.21809)/ ReferEverything
    • DAViD(arXiv 2507.15365)/ Sapiens / Genmo(arXiv 2505.01425)
    • Marigold / GenPercept / DepthCrafter / NormalCrafter / Geo4D(diffusion-repurposing 谱系)