生成 vs 指代:2026 年视觉推理的范式分叉

从 Vision Banana 到 Thinking with Visual Primitives,谈多模态推理的两条未来路线

Ehco · 2026 年 5 月 · 阅读时间约 25 分钟


摘要

2026 年 4 月的最后一周,Google DeepMind 发布了 Image Generators are Generalist Vision Learners(Vision Banana),DeepSeek 发布了 Thinking with Visual Primitives。这两篇时间几乎完全重合的论文,对"VLM 应该如何完成视觉推理"给出了两个相反的答案——一个走生成式,让所有视觉任务都变成生成 RGB 图像;一个走自回归,把空间坐标 token 直接嵌入 chain-of-thought。

本文试图把这两条路线放在同一张地图上比较,分析它们各自的理论根基、工程权衡、以及对未来 VLA(Vision-Language-Action)的启示。核心论点是:这两篇论文不是平行的两个工作,而是定义了未来 1–2 年多模态推理的两条主线——它们攻击的是同一个 bottleneck,但解法的范式假设完全相反。


目录

  1. 引言:同一周内的两个相反答案
  2. 背景:被忽视的"指代鸿沟"
  3. 视觉思考的层次:从 Level 0 到 Level 3
  4. 路线 A:生成即理解(Vision Banana)
  5. 路线 B:指代即思考(DeepSeek Visual Primitives)
  6. 范式对照:八个维度的深度比较
  7. 理论视角:为什么这两条路同时浮现
  8. 对 VLA 的具体启示
  9. 几个值得保留的怀疑
  10. 结语:双线收敛?
  11. 参考资料索引

1. 引言:同一周内的两个相反答案

2026 年 4 月 23 日,DeepMind 在 arXiv 上挂出 Image Generators are Generalist Vision Learners。作者列表上有 Kaiming He、Saining Xie、Jonathan Barron、Thomas Funkhouser、Jean-Baptiste Alayrac 这种级别的名字。论文的中心结论很直接:把 Nano Banana Pro(Google 的图像生成模型)拿来做轻量 instruction tuning,得到的 Vision Banana 在 Cityscapes、ReasonSeg、metric depth、surface normal 等任务上全面超过 SAM 3、Depth Anything 3、Lotus-2 这些专门模型

七天后的 4 月 30 日,DeepSeek 在 GitHub 放出 Thinking with Visual Primitives——基于刚发布的 V4-Flash(284B 总参 / 13B 激活的 MoE)和自研 ViT,提出了一个截然不同的方案:把点坐标和边界框作为基本推理单元,像文本一样穿插在 chain-of-thought 里。报告中的模型在 counting 和空间推理 benchmark 上能与 GPT-5.4、Claude Sonnet 4.6、Gemini 3-Flash 持平。(值得一提的是,这个 repo 在发布后不久被悄悄删除,PDF 通过 HuggingFace 镜像还能找到。)

放在同一张桌子上看,这两篇论文有趣到不可思议:

读懂这两篇论文的对照,比单独读任何一篇都更有价值——它们不只是两个工作,而是两个对未来 multimodal AI 的判断


2. 背景:被忽视的"指代鸿沟"

要理解这两篇论文为什么同时出现,先要理解它们试图解决的问题。

过去两年 VLM 的研究路线,主流是在攻击Perception Gap(感知鸿沟)——也就是"模型能不能看清细节"。AnyRes、动态 patching、高分辨率 ViT、tile-based encoding——这些技术解决的都是同一个问题:让模型从输入图像中提取出更精细的视觉特征。

DeepSeek 的论文最有洞察力的地方,是它点出了一个被忽视的、更根本的瓶颈

Reference Gap(指代鸿沟):模型能"看见",但在用自然语言构建思维链时,无法精确地"指着"某个对象说话。

举一个具体例子。给 GPT-5.4 一张密集人群的照片问"图里有多少人",它的内部推理是用文字进行的——"左边那个穿红色的男人"、"中间偏右的小孩"、"那群人前面的"。在密集场景下,这种语言级别的指代根本不够精确:当你说"中央偏左那个红色物体",可能有十个候选;模型的 attention 会在这些候选之间漂移,导致计数错误、推理链断裂。

这个观察非常深刻。它把 VLM 的失败模式分成了两个独立的因果:

Perception Gap Reference Gap
含义 看不清 看见了但无法精确指代
现有解法 高分辨率、tile、AnyRes 几乎没有系统性方案
主流认知 已被广泛研究 过去被严重忽视
决定的任务 OCR、细节识别 counting、空间推理、grounding

更关键的是:Perception Gap 解决得再好,也救不了 Reference Gap。你可以让模型看清每一根头发,但只要它的思维载体是自然语言,就无法在 chain-of-thought 中精确定位"第 17 个穿条纹衬衫的人"。

而这正是 Vision Banana 和 DeepSeek 各自给出的两个不同攻击点——前者用改变思维的载体(让 RGB 图像本身成为思考输出),后者用给思维加上空间锚(在文本 CoT 中植入精确坐标)。


3. 视觉思考的层次:从 Level 0 到 Level 3

在深入两篇论文之前,先建立一个分类框架。"用图像思考"这个表述本身就有歧义——不同方法做的事情其实分布在一个连续光谱上。我把它梳理成四个层次:

视觉思考的四个层次 从"看图说话"到"跨模态自由推理" Level 0 · 看图说话 输入图像 → 文本推理 → 文本答案。视觉信息只在输入端进入,所有思考都在文本空间。 代表:标准 VLM(LLaVA、Qwen-VL、GPT-4V) Level 1 · 工具/中间图像 在 CoT 中调用绘图工具或生成中间图像,再"看回"图像继续推理。绕了一圈,本质是文本-图像-文本。 代表:Visual Sketchpad(NeurIPS 2024)、MVoT、Whiteboard-of-Thought Level 1.5 · 结构化空间 token (路线 B) 在 AR 文本流中穿插点坐标 / bbox 等空间 token,作为思维的最小指代单元。半符号化的视觉思考。 代表:DeepSeek Thinking with Visual Primitives(2026.04) Level 2 · 生成式视觉理解 (路线 A) 在生成模型的连续 latent dynamics 里完成"思考",输出本身是承载结论的 RGB 图像。 代表:Vision Banana(2026.04)、Lotus、Marigold、Diception Level 3 · 跨模态自由推理 (尚未实现) 模型在视觉 / 语言 / 动作 latent 之间自由切换,按任务需要选择思考的模态。 候选方向:JEPA 系、World Model + LLM 融合、统一损失架构

这个分类的核心洞察是:Vision Banana 和 DeepSeek 不是同一层次的两个方法,而是分别占据了 Level 1.5 和 Level 2 这两个完全不同的位置。它们在结构上不构成竞争——它们各自定义了一种全新的"视觉思考"形式。


4. 路线 A:生成即理解(Vision Banana)

核心思想

一句话:把所有视觉任务的输出参数化为 RGB 图像,让生成模型同时是理解模型。

这听起来像个奇怪的设计选择,直到你意识到它在 NLP 里早就发生过——T5、InstructGPT 时代证明了"任何 NLP 任务都能写成 text-in / text-out"。Vision Banana 是它的视觉对偶版本:任何视觉任务都能写成 image-in / image-out

关键设计:可逆的 RGB 编码

最巧妙的部分在 depth 估计上。深度值是 [0, ∞) 的连续标量,怎么塞进 [0, 1]³ 的 RGB cube?论文用了 Barron 2025 的 power transform 把 depth 弯曲到 [0, 1),再沿 RGB 立方体的边缘做类似 Hilbert curve 的分段插值,构造出一个双射——训练时用这个映射把 ground-truth depth 编成彩色图,推理时反向解码就能拿回精确的米单位深度。

Segmentation 同理:让模型为不同 instance 自动分配不同颜色,evaluation 时用阈值聚类。Referring expression 直接 prompt "用纯黄色分割滑板"。所有 task-specific 的部分都被外移到了 prompt 里,模型本身不需要任何架构改动。

Vision Banana 工作流 在生成模型的 latent 中"思考",输出 RGB 图像作为答案 输入图像 指令 prompt "Generate a depth visualization using the Hilbert color map" 生成模型 (Nano Banana Pro) z₀ z_t z_T 连续 latent 中的 N 步去噪 "思考"在这里完成 无 task-specific head · 无离散 token RGB 输出 解码结果 Metric depth / seg mask / surface normal 关键:RGB 是通用接口,所有 task-specific 设计都在 prompt 里

实验亮点

最后一点非常重要。其他方法几乎都依赖 camera intrinsics(要么训练时要么推理时),Vision Banana 完全不用。这意味着 Nano Banana Pro 在生成预训练阶段,已经隐式地学到了"物体的真实大小尺度先验"——这才是真正的 emergent capability。

论文的中心论点

生成式预训练对视觉的作用,类似 LLM 预训练对语言的作用。

这是一个非常激进的 claim,但它有硬证据支撑。如果它是对的,意味着过去十年 vision representation learning 的主流(contrastive 的 CLIP/SigLIP、bootstrapping 的 DINOv2/v3、masked 的 MAE/iBot)虽然有用,但都不是终局。终局是足够强的图像/视频生成器,理解能力作为生成预训练的副产品 emerge 出来。


5. 路线 B:DeepSeek Visual Primitives(指代即思考)

核心思想

一句话:把点坐标和边界框作为推理的最小单元,像文本 token 一样穿插在 chain-of-thought 中。

注意这和"输出 bbox"是两码事。传统 grounding 方法把 bbox 当作输出——模型先用文字想完,最后告诉你"目标位于 [100, 200, 300, 400]"。Visual Primitives 把 bbox 当作思考过程的一部分——在 CoT 中间,模型直接生成 <box>...</box> 这样的空间 token,把"中央偏左那个红色物体"换成精确坐标,然后基于这个坐标继续推理。

三步思考协议

报告中描述的训练协议是一个结构化的三段论:

  1. Intent Analysis——识别任务目标类别
  2. Batch Grounding——一次性用 visual primitives 定位所有候选对象(而不是一个一个数)
  3. Statistical Summation——基于这些 primitives 做计数或推理

第二步是关键。Batch grounding 利用了模型的 localization 能力,避免了 sequential enumeration 时的 attention 漂移。这非常像人类的 counting 策略——你不会从左到右一个一个数,而是先把所有符合特征的对象"圈起来",再数有多少个圈。

工作流示意

DeepSeek Visual Primitives 工作流 在 AR 文本流中穿插空间 token 作为指代锚点 输入图像 "几个红色圆点?" ViT 任意分辨率 编码器 V4-Flash MoE · 自回归推理 Intent: 数红点 "我需要" <box>[58,66,...] <box>[78,86,...] <box>[98,106,...] ... Batch grounding <box> ... <box> ... <box> "已锚定 6 个候选" Summation "逐个验证特征匹配" 答案: 6 Visual Primitives 与文本 token 同处一条 AR 序列 空间锚点替代模糊语言指代 推理步骤标记 普通文本 token 空间 token(point / bbox) 最终答案 关键:思考过程不离开 AR 框架,但加上了精确的空间锚点

巧妙之处

这个折中点其实非常聪明,因为它保留了 AR 的所有工程优势——KV cache、CoT 可解释、speculative decoding 兼容、distillation 友好——同时绕开了文字 token 的精度瓶颈

更重要的是它的部署友好性:不需要重新训生成器,不需要新的解码 pipeline,现有的 AR-LLM 推理基础设施可以直接用。这在工程上是巨大的优势。

实验亮点

但要注意:这些 benchmark 恰好是 reference-heavy 的任务——counting 和 grounding 都是 Visual Primitives 方法最容易出彩的场景。在更广义的 multimodal reasoning(图表理解、长 OCR、视频)上能不能保持优势,需要更多评测。


6. 范式对照:八个维度的深度比较

把两条路线放在同一张表上,分歧才能真正暴露:

两条路线的八维对照 维度 路线 A · Vision Banana 生成式 / 路线 A 路线 B · Visual Primitives 自回归 / 路线 B 基础范式 Foundational paradigm Diffusion / Flow Matching 图像生成器 AR + ViT + 结构化空间 token "思考"在哪发生 Where reasoning happens 连续 latent 中的多步去噪 / 流动 AR token 序列中的 CoT 通用接口 Universal interface RGB 图像(image as output) 空间坐标 token(structured text) 视觉 ambiguity 处理 Handling ambiguity Mode-seeking 天然处理多模态 精确 bbox 消除指代歧义 推理成本 Inference cost 高(多步去噪,N × forward) 低(标准 AR + KV cache) 现有生态兼容性 Ecosystem compatibility 需要重新训生成器 直接复用 AR-LLM 基础设施 表达天花板 Expressiveness ceiling 高(任意 RGB 可视化) 中(点/框难表达形变、关系) 最适合的任务 Best-fit tasks 密集预测(depth/normal/seg) counting / grounding / 推理 关键观察: 这两条路线在表达能力、推理成本、生态成熟度上呈互补关系——它们更可能共存,而不是一方淘汰另一方。

几个值得专门拎出来谈的差异:

关于推理成本。 Vision Banana 的 N 步去噪(即使用 consistency model 也至少 4-8 步)vs DeepSeek 的标准 AR 解码——后者快了至少一个数量级。这在边缘部署、实时应用上是结构性差距。

关于"思考"的物理位置。 Vision Banana 的思考在生成器的 latent dynamics 里完成,不可见、不可干预;DeepSeek 的思考是 token 序列,可读、可干预、可 distillation。这对工业落地的可解释性要求是质的差别。

关于表达天花板。 Vision Banana 能输出任意可视化(你想用什么 colormap 表达深度都行),Visual Primitives 的点和 bbox 在表达形变、变化中的对象、抽象关系("两个东西的对称轴")上力不从心。这是 Visual Primitives 路线的一个固有上限。


7. 理论视角:为什么这两条路同时浮现

为什么是 2026 年 4 月?为什么是同一周?这不是巧合。

共同的前置条件

两条路线都建立在三个 2024-2025 年的 enabling factor 之上:

  1. 图像/视频生成器达到了 photorealism 阈值——Nano Banana Pro、Veo 3、FLUX.2 这一代生成器的输出已经接近真实,足以承载精细的视觉信息。
  2. MoE 架构让大模型推理成本可控——DeepSeek V4-Flash 这种 13B 激活的设计,让 284B 参数的模型能跑在 reasonable 的硬件上。
  3. Reasoning trace 范式被 o1/R1 验证可行——长链 CoT 不再是奇技淫巧,而是 production 模型的标准能力。

但这些只解释了"两条路为什么现在都跑得通",没解释"为什么必须是两条路"。

信息几何视角的解释

回到一个本源问题:视觉信息和语言信息在数据流形上的几何性质完全不同

语言是离散的、序列的、有自然 ordering 的——所以 AR 是它的天然范式。文本 token 的链式法则分解 $p(x) = \prod p(x_t \mid x_{

图像是连续的、并行的、没有 ordering 的——所以 Diffusion/FM 是它的天然范式。学习一个 score field 或速度场,比强行把图像 raster 化成 token 序列要"几何上更干净"。

Vision Banana 路线本质上是在拥抱这个差异——它说视觉就该用视觉的方式处理,语言就该用语言的方式处理,两者的耦合在 prompt 这个最薄的层面发生。

DeepSeek Visual Primitives 路线本质上是在调和这个差异——它说虽然视觉和语言不同,但我们可以发明一种中间表示(结构化空间 token),让两者能在同一个 AR 框架里协作。

这两个 philosophy 都有道理,而且没有显而易见的胜负。这才是为什么它们同时出现——它们不是同一个问题的两个解法,而是两个不同 philosophy 各自走到的地方

NLP 类比的局限

很多人会用"AR 在 NLP 完胜 diffusion-LM"来类比说"AR 也会在 vision 胜出"。这个类比是错的,原因在于:

所以 AR 在 vision 里的优势从来不是范式优势,而是生态优势(成熟的 LLM 基础设施可以复用)。Vision Banana 试图证明:当生态优势被抹平后(也就是有了足够强的图像生成器作为 base),生成式范式才是 vision 的"原生"路线。


8. 对 VLA 的具体启示

这部分是我个人最感兴趣的——这两条路线对未来的 VLA(Vision-Language-Action)会产生什么影响。

启示 1:动作 = 对世界的指代

机器人动作本质上是对世界的一种 reference——"夹爪去抓那个杯子"在执行层面就是"夹爪移动到 (x, y, z) 然后闭合"。

DeepSeek 的 Visual Primitives 给出了一个统一表达"思考-指代-动作"的语法

VLA 中的统一 token 流 把"思考-指代-动作"放进同一条 AR 序列 [obs_t] 视觉编码 观测 "我需要抓" "那个红杯子" 语言推理 <box> [245,180,320,290] 空间指代 "抓取中心在" 语言推理 <point> (282,235) 3D 锚点 <action_chunk> [Δx, Δy, Δz, Δrx, ..., grip] × 50 动作输出 同一条 AR token 流 语言 token(CoT 推理) 空间 token(DeepSeek 风格) 动作 token(OpenVLA 风格 / 接 FM head) 核心想法: 把"OpenVLA 的动作 token 化"和"DeepSeek 的空间 token 化"合并到同一条 AR 流;动作头还可以接 FM 出连续 chunk。

这其实就是把 OpenVLA 的"动作 token 化"和 DeepSeek 的"空间 token 化"合并到同一条 token 流——而且这个流既有思考也有动作,完全可以用同一套 RL 训练。这是可能成为下一代 VLA 标准格式的设计

启示 2:视觉编码器选型可能要重新考虑

现在的 VLA(OpenVLA、π0、RDT)几乎都在用 SigLIP/DINOv2 这种 contrastive/bootstrapping 编码器接 LLM。Vision Banana 的结论暗示:图像/视频生成器的 internal representation 可能更适合机器人——因为它隐含了几何、深度、物体边界这些机器人真正需要的东西,而 contrastive 编码器是按"语义相似性"对齐的,对几何相对粗糙。

短期内不会有人立刻把 PaliGemma 替换掉(成本太高),但如果后续工作把 Vision Banana 的 insight 推到 video generator(比如 Veo 3、Sora 的内部表征)作为 VLA backbone,是有可能跑出新 SOTA 的。

启示 3:Reference Gap 在机器人上更严重

在 VQA 任务里指代不准最多答错;在机器人上指代不准是直接撞东西。所以 Reference Gap 这个概念在 VLA 上是更高优先级的痛点。π0 等用连续 action chunk + diffusion 是一种解法(绕开了语言精度问题),但代价是丢失了语言可解释性。DeepSeek 的方法理论上能让 VLA既保留 CoT 可解释性,又拿到坐标级别的精度

启示 4:硬件约束驱动的范式选择

如果要按硬件场景做范式选择:

这种"按硬件约束选范式"的判断能力,是当前 VLA 求职市场的稀缺能力。


9. 几个值得保留的怀疑

不是所有 claim 都该全盘接受。以下是我对两篇论文各自保留的几点 skepticism:

对 Vision Banana

对 DeepSeek Visual Primitives

对两者共同的 skepticism


10. 结语:双线收敛?

如果我必须给一个判断,我会这样表述:

短期(1-2 年):DeepSeek 路线落地更快。原因不在范式优势,而在生态成熟度——AR-LLM 的所有基础设施(KV cache、speculative decoding、RLHF/RLAIF、distillation 工具链)都可以直接复用。Vision Banana 路线虽然 representation 更优,但需要重新搭建生成式推理的整套 pipeline,这个工程债不是一个 product cycle 能还清的。

中期(2-3 年):两条路线很可能收敛到一个混合架构——AR 主干处理 high-level 规划和指代(用 Visual Primitives 风格),生成式头处理 dense prediction 和动作生成(用 Vision Banana / Flow Matching 风格)。这个混合架构在 VLA 上其实已经有雏形——π0 的"VLM 主干 + FM action expert"就是这个路子,未来可能演化为"VLM 主干 + Visual Primitives 思考 + 生成式 perception head + FM action head"的四段式设计。

长期(5 年+):Level 3 的真正跨模态自由推理需要新架构。可能是 JEPA 路线,可能是 energy-based 方法的复兴,也可能是某种我们还没见过的统一框架。在这个框架里,"用文字思考"和"用图像思考"不再是设计选择,而是模型按任务自适应切换的内部行为。

无论哪条路最终胜出,2026 年 4 月这两篇论文都值得被记住——它们不是某个 benchmark 上的 +X 个点,而是重新定义了 multimodal AI 的 design space

如果你正在做 VLA、多模态、或者 vision foundation model 的研究,理解这两条路线的对照,可能比任何一篇 SOTA 论文的细节都更重要。


参考资料索引

核心论文

  1. Vision Banana — V. Gabeur, S. Long, S. Peng, et al. Image Generators are Generalist Vision Learners. arXiv:2604.20329. Google DeepMind. 2026.04.23. - Project: vision-banana.github.io - 核心贡献:证明生成式预训练等价于通用视觉学习

  2. Thinking with Visual Primitives — R. Lu, Y. Ma, et al. (DeepSeek + Peking University + Tsinghua). Thinking with Visual Primitives. 2026.04.30. - GitHub: 已删除;PDF 镜像可在 HuggingFace NodeLinker/deepseek-ai-Thinking-with-Visual-Primitives-deleted-repo 找到 - 核心贡献:提出 Reference Gap 概念和空间 token CoT

直接相关的前置工作

  1. Visual Sketchpad — Y. Hu, et al. Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models. NeurIPS 2024.
  2. Coconut (Continuous Thought) — S. Hao, et al. Training Large Language Models to Reason in a Continuous Latent Space. Meta. 2024.
  3. SAM 3 — N. Carion, et al. Segment Anything with Concepts. arXiv:2511.16719. 2025.
  4. Depth Anything 3 — H. Lin, et al. Depth Anything 3: Recovering the Visual Space from Any Views. arXiv:2511.10647. 2025.
  5. DeepSeek-V4 — DeepSeek-AI. DeepSeek-V4 Technical Report. 2026.04.24.

VLA 相关参考

  1. OpenVLA — M. Kim, et al. OpenVLA: An Open-Source Vision-Language-Action Model. 2024.
  2. π0 (Pi-Zero) — Physical Intelligence. π0: A Vision-Language-Action Flow Model. 2024.
  3. RDT-1B — S. Liu, et al. RDT-1B: A Diffusion Foundation Model for Bimanual Manipulation. 2024.
  4. OpenVLA-OFTOptimizing Fine-tuning for OpenVLA with Parallel Decoding. 2024.

范式理论参考

  1. Flow Matching — Y. Lipman, R. Chen, H. Ben-Hamu, et al. Flow Matching for Generative Modeling. ICLR 2023.
  2. Stochastic Interpolants — M. Albergo, E. Vanden-Eijnden. Building Normalizing Flows with Stochastic Interpolants. ICLR 2023.
  3. Score Matching — A. Hyvärinen. Estimation of Non-Normalized Statistical Models by Score Matching. JMLR 2005.
  4. Rectified Flow — X. Liu, et al. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. 2022.

方法论参考

  1. Marigold — B. Ke, A. Obukhov, et al. Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation. CVPR 2024.
  2. Lotus / Lotus-2 — J. He, et al. Lotus / Lotus-2: Diffusion-Based Visual Foundation Model for Dense Prediction. 2024-2025.
  3. Diception — C. Zhao, et al. Diception: A Generalist Diffusion Model for Visual Perceptual Tasks. arXiv:2502.17157. 2025.
  4. Power Transform — J. T. Barron. A Power Transform. arXiv:2502.10647. 2025.

本文写于 2026 年 5 月。如果你对其中某条路线有不同看法,或者想讨论具体的 VLA 落地路径,欢迎交流。

— Ehco