生成 vs 指代:2026 年视觉推理的范式分叉
从 Vision Banana 到 Thinking with Visual Primitives,谈多模态推理的两条未来路线
Ehco · 2026 年 5 月 · 阅读时间约 25 分钟
摘要
2026 年 4 月的最后一周,Google DeepMind 发布了 Image Generators are Generalist Vision Learners(Vision Banana),DeepSeek 发布了 Thinking with Visual Primitives。这两篇时间几乎完全重合的论文,对"VLM 应该如何完成视觉推理"给出了两个相反的答案——一个走生成式,让所有视觉任务都变成生成 RGB 图像;一个走自回归,把空间坐标 token 直接嵌入 chain-of-thought。
本文试图把这两条路线放在同一张地图上比较,分析它们各自的理论根基、工程权衡、以及对未来 VLA(Vision-Language-Action)的启示。核心论点是:这两篇论文不是平行的两个工作,而是定义了未来 1–2 年多模态推理的两条主线——它们攻击的是同一个 bottleneck,但解法的范式假设完全相反。
目录
- 引言:同一周内的两个相反答案
- 背景:被忽视的"指代鸿沟"
- 视觉思考的层次:从 Level 0 到 Level 3
- 路线 A:生成即理解(Vision Banana)
- 路线 B:指代即思考(DeepSeek Visual Primitives)
- 范式对照:八个维度的深度比较
- 理论视角:为什么这两条路同时浮现
- 对 VLA 的具体启示
- 几个值得保留的怀疑
- 结语:双线收敛?
- 参考资料索引
1. 引言:同一周内的两个相反答案
2026 年 4 月 23 日,DeepMind 在 arXiv 上挂出 Image Generators are Generalist Vision Learners。作者列表上有 Kaiming He、Saining Xie、Jonathan Barron、Thomas Funkhouser、Jean-Baptiste Alayrac 这种级别的名字。论文的中心结论很直接:把 Nano Banana Pro(Google 的图像生成模型)拿来做轻量 instruction tuning,得到的 Vision Banana 在 Cityscapes、ReasonSeg、metric depth、surface normal 等任务上全面超过 SAM 3、Depth Anything 3、Lotus-2 这些专门模型。
七天后的 4 月 30 日,DeepSeek 在 GitHub 放出 Thinking with Visual Primitives——基于刚发布的 V4-Flash(284B 总参 / 13B 激活的 MoE)和自研 ViT,提出了一个截然不同的方案:把点坐标和边界框作为基本推理单元,像文本一样穿插在 chain-of-thought 里。报告中的模型在 counting 和空间推理 benchmark 上能与 GPT-5.4、Claude Sonnet 4.6、Gemini 3-Flash 持平。(值得一提的是,这个 repo 在发布后不久被悄悄删除,PDF 通过 HuggingFace 镜像还能找到。)
放在同一张桌子上看,这两篇论文有趣到不可思议:
- 它们攻击的是同一个核心问题——为什么现在的 VLM 在精细空间推理上系统性地差。
- 它们给出的核心方案恰好相反——一个让模型"用画笔思考",一个让模型"用坐标思考"。
- 它们各自代表的范式(生成式 vs 自回归)在 NLP 战场已经分出胜负(AR 完胜),但在 vision 战场重新开打。
读懂这两篇论文的对照,比单独读任何一篇都更有价值——它们不只是两个工作,而是两个对未来 multimodal AI 的判断。
2. 背景:被忽视的"指代鸿沟"
要理解这两篇论文为什么同时出现,先要理解它们试图解决的问题。
过去两年 VLM 的研究路线,主流是在攻击Perception Gap(感知鸿沟)——也就是"模型能不能看清细节"。AnyRes、动态 patching、高分辨率 ViT、tile-based encoding——这些技术解决的都是同一个问题:让模型从输入图像中提取出更精细的视觉特征。
DeepSeek 的论文最有洞察力的地方,是它点出了一个被忽视的、更根本的瓶颈:
Reference Gap(指代鸿沟):模型能"看见",但在用自然语言构建思维链时,无法精确地"指着"某个对象说话。
举一个具体例子。给 GPT-5.4 一张密集人群的照片问"图里有多少人",它的内部推理是用文字进行的——"左边那个穿红色的男人"、"中间偏右的小孩"、"那群人前面的"。在密集场景下,这种语言级别的指代根本不够精确:当你说"中央偏左那个红色物体",可能有十个候选;模型的 attention 会在这些候选之间漂移,导致计数错误、推理链断裂。
这个观察非常深刻。它把 VLM 的失败模式分成了两个独立的因果:
| Perception Gap | Reference Gap | |
|---|---|---|
| 含义 | 看不清 | 看见了但无法精确指代 |
| 现有解法 | 高分辨率、tile、AnyRes | 几乎没有系统性方案 |
| 主流认知 | 已被广泛研究 | 过去被严重忽视 |
| 决定的任务 | OCR、细节识别 | counting、空间推理、grounding |
更关键的是:Perception Gap 解决得再好,也救不了 Reference Gap。你可以让模型看清每一根头发,但只要它的思维载体是自然语言,就无法在 chain-of-thought 中精确定位"第 17 个穿条纹衬衫的人"。
而这正是 Vision Banana 和 DeepSeek 各自给出的两个不同攻击点——前者用改变思维的载体(让 RGB 图像本身成为思考输出),后者用给思维加上空间锚(在文本 CoT 中植入精确坐标)。
3. 视觉思考的层次:从 Level 0 到 Level 3
在深入两篇论文之前,先建立一个分类框架。"用图像思考"这个表述本身就有歧义——不同方法做的事情其实分布在一个连续光谱上。我把它梳理成四个层次:
这个分类的核心洞察是:Vision Banana 和 DeepSeek 不是同一层次的两个方法,而是分别占据了 Level 1.5 和 Level 2 这两个完全不同的位置。它们在结构上不构成竞争——它们各自定义了一种全新的"视觉思考"形式。
4. 路线 A:生成即理解(Vision Banana)
核心思想
一句话:把所有视觉任务的输出参数化为 RGB 图像,让生成模型同时是理解模型。
这听起来像个奇怪的设计选择,直到你意识到它在 NLP 里早就发生过——T5、InstructGPT 时代证明了"任何 NLP 任务都能写成 text-in / text-out"。Vision Banana 是它的视觉对偶版本:任何视觉任务都能写成 image-in / image-out。
关键设计:可逆的 RGB 编码
最巧妙的部分在 depth 估计上。深度值是 [0, ∞) 的连续标量,怎么塞进 [0, 1]³ 的 RGB cube?论文用了 Barron 2025 的 power transform 把 depth 弯曲到 [0, 1),再沿 RGB 立方体的边缘做类似 Hilbert curve 的分段插值,构造出一个双射——训练时用这个映射把 ground-truth depth 编成彩色图,推理时反向解码就能拿回精确的米单位深度。
Segmentation 同理:让模型为不同 instance 自动分配不同颜色,evaluation 时用阈值聚类。Referring expression 直接 prompt "用纯黄色分割滑板"。所有 task-specific 的部分都被外移到了 prompt 里,模型本身不需要任何架构改动。
实验亮点
- Cityscapes mIoU 0.699,超过 SAM 3 的 0.652(+4.7 pts)
- ReasonSeg gIoU 0.793,超过 SAM 3 + Gemini 2.5 Pro 组合的 0.770
- Metric depth 平均 δ1 0.929(NYU/ETH3D/DIODE/KITTI),超过 Depth Anything 3 的 0.918
- 关键的是:训练数据完全是 synthetic 3D + in-house 2D 标注,从未见过任何 evaluation benchmark 的训练集
- 不需要 camera intrinsics——完全靠生成模型从图像本身推断出物理尺度
最后一点非常重要。其他方法几乎都依赖 camera intrinsics(要么训练时要么推理时),Vision Banana 完全不用。这意味着 Nano Banana Pro 在生成预训练阶段,已经隐式地学到了"物体的真实大小尺度先验"——这才是真正的 emergent capability。
论文的中心论点
生成式预训练对视觉的作用,类似 LLM 预训练对语言的作用。
这是一个非常激进的 claim,但它有硬证据支撑。如果它是对的,意味着过去十年 vision representation learning 的主流(contrastive 的 CLIP/SigLIP、bootstrapping 的 DINOv2/v3、masked 的 MAE/iBot)虽然有用,但都不是终局。终局是足够强的图像/视频生成器,理解能力作为生成预训练的副产品 emerge 出来。
5. 路线 B:DeepSeek Visual Primitives(指代即思考)
核心思想
一句话:把点坐标和边界框作为推理的最小单元,像文本 token 一样穿插在 chain-of-thought 中。
注意这和"输出 bbox"是两码事。传统 grounding 方法把 bbox 当作输出——模型先用文字想完,最后告诉你"目标位于 [100, 200, 300, 400]"。Visual Primitives 把 bbox 当作思考过程的一部分——在 CoT 中间,模型直接生成 <box>...</box> 这样的空间 token,把"中央偏左那个红色物体"换成精确坐标,然后基于这个坐标继续推理。
三步思考协议
报告中描述的训练协议是一个结构化的三段论:
- Intent Analysis——识别任务目标类别
- Batch Grounding——一次性用 visual primitives 定位所有候选对象(而不是一个一个数)
- Statistical Summation——基于这些 primitives 做计数或推理
第二步是关键。Batch grounding 利用了模型的 localization 能力,避免了 sequential enumeration 时的 attention 漂移。这非常像人类的 counting 策略——你不会从左到右一个一个数,而是先把所有符合特征的对象"圈起来",再数有多少个圈。
工作流示意
巧妙之处
这个折中点其实非常聪明,因为它保留了 AR 的所有工程优势——KV cache、CoT 可解释、speculative decoding 兼容、distillation 友好——同时绕开了文字 token 的精度瓶颈。
更重要的是它的部署友好性:不需要重新训生成器,不需要新的解码 pipeline,现有的 AR-LLM 推理基础设施可以直接用。这在工程上是巨大的优势。
实验亮点
- 在 counting 和空间推理任务上能与 GPT-5.4、Claude Sonnet 4.6、Gemini 3-Flash 持平
- 视觉 token 预算显著更小(这是 token efficiency 的胜利)
- 模型规模相对紧凑(13B 激活)
但要注意:这些 benchmark 恰好是 reference-heavy 的任务——counting 和 grounding 都是 Visual Primitives 方法最容易出彩的场景。在更广义的 multimodal reasoning(图表理解、长 OCR、视频)上能不能保持优势,需要更多评测。
6. 范式对照:八个维度的深度比较
把两条路线放在同一张表上,分歧才能真正暴露:
几个值得专门拎出来谈的差异:
关于推理成本。 Vision Banana 的 N 步去噪(即使用 consistency model 也至少 4-8 步)vs DeepSeek 的标准 AR 解码——后者快了至少一个数量级。这在边缘部署、实时应用上是结构性差距。
关于"思考"的物理位置。 Vision Banana 的思考在生成器的 latent dynamics 里完成,不可见、不可干预;DeepSeek 的思考是 token 序列,可读、可干预、可 distillation。这对工业落地的可解释性要求是质的差别。
关于表达天花板。 Vision Banana 能输出任意可视化(你想用什么 colormap 表达深度都行),Visual Primitives 的点和 bbox 在表达形变、变化中的对象、抽象关系("两个东西的对称轴")上力不从心。这是 Visual Primitives 路线的一个固有上限。
7. 理论视角:为什么这两条路同时浮现
为什么是 2026 年 4 月?为什么是同一周?这不是巧合。
共同的前置条件
两条路线都建立在三个 2024-2025 年的 enabling factor 之上:
- 图像/视频生成器达到了 photorealism 阈值——Nano Banana Pro、Veo 3、FLUX.2 这一代生成器的输出已经接近真实,足以承载精细的视觉信息。
- MoE 架构让大模型推理成本可控——DeepSeek V4-Flash 这种 13B 激活的设计,让 284B 参数的模型能跑在 reasonable 的硬件上。
- Reasoning trace 范式被 o1/R1 验证可行——长链 CoT 不再是奇技淫巧,而是 production 模型的标准能力。
但这些只解释了"两条路为什么现在都跑得通",没解释"为什么必须是两条路"。
信息几何视角的解释
回到一个本源问题:视觉信息和语言信息在数据流形上的几何性质完全不同。
语言是离散的、序列的、有自然 ordering 的——所以 AR 是它的天然范式。文本 token 的链式法则分解 $p(x) = \prod p(x_t \mid x_{ 图像是连续的、并行的、没有 ordering 的——所以 Diffusion/FM 是它的天然范式。学习一个 score field 或速度场,比强行把图像 raster 化成 token 序列要"几何上更干净"。 Vision Banana 路线本质上是在拥抱这个差异——它说视觉就该用视觉的方式处理,语言就该用语言的方式处理,两者的耦合在 prompt 这个最薄的层面发生。 DeepSeek Visual Primitives 路线本质上是在调和这个差异——它说虽然视觉和语言不同,但我们可以发明一种中间表示(结构化空间 token),让两者能在同一个 AR 框架里协作。 这两个 philosophy 都有道理,而且没有显而易见的胜负。这才是为什么它们同时出现——它们不是同一个问题的两个解法,而是两个不同 philosophy 各自走到的地方。 很多人会用"AR 在 NLP 完胜 diffusion-LM"来类比说"AR 也会在 vision 胜出"。这个类比是错的,原因在于: 所以 AR 在 vision 里的优势从来不是范式优势,而是生态优势(成熟的 LLM 基础设施可以复用)。Vision Banana 试图证明:当生态优势被抹平后(也就是有了足够强的图像生成器作为 base),生成式范式才是 vision 的"原生"路线。 这部分是我个人最感兴趣的——这两条路线对未来的 VLA(Vision-Language-Action)会产生什么影响。 机器人动作本质上是对世界的一种 reference——"夹爪去抓那个杯子"在执行层面就是"夹爪移动到 (x, y, z) 然后闭合"。 DeepSeek 的 Visual Primitives 给出了一个统一表达"思考-指代-动作"的语法: 这其实就是把 OpenVLA 的"动作 token 化"和 DeepSeek 的"空间 token 化"合并到同一条 token 流——而且这个流既有思考也有动作,完全可以用同一套 RL 训练。这是可能成为下一代 VLA 标准格式的设计。 现在的 VLA(OpenVLA、π0、RDT)几乎都在用 SigLIP/DINOv2 这种 contrastive/bootstrapping 编码器接 LLM。Vision Banana 的结论暗示:图像/视频生成器的 internal representation 可能更适合机器人——因为它隐含了几何、深度、物体边界这些机器人真正需要的东西,而 contrastive 编码器是按"语义相似性"对齐的,对几何相对粗糙。 短期内不会有人立刻把 PaliGemma 替换掉(成本太高),但如果后续工作把 Vision Banana 的 insight 推到 video generator(比如 Veo 3、Sora 的内部表征)作为 VLA backbone,是有可能跑出新 SOTA 的。 在 VQA 任务里指代不准最多答错;在机器人上指代不准是直接撞东西。所以 Reference Gap 这个概念在 VLA 上是更高优先级的痛点。π0 等用连续 action chunk + diffusion 是一种解法(绕开了语言精度问题),但代价是丢失了语言可解释性。DeepSeek 的方法理论上能让 VLA既保留 CoT 可解释性,又拿到坐标级别的精度。 如果要按硬件场景做范式选择: 这种"按硬件约束选范式"的判断能力,是当前 VLA 求职市场的稀缺能力。 不是所有 claim 都该全盘接受。以下是我对两篇论文各自保留的几点 skepticism: 如果我必须给一个判断,我会这样表述: 短期(1-2 年):DeepSeek 路线落地更快。原因不在范式优势,而在生态成熟度——AR-LLM 的所有基础设施(KV cache、speculative decoding、RLHF/RLAIF、distillation 工具链)都可以直接复用。Vision Banana 路线虽然 representation 更优,但需要重新搭建生成式推理的整套 pipeline,这个工程债不是一个 product cycle 能还清的。 中期(2-3 年):两条路线很可能收敛到一个混合架构——AR 主干处理 high-level 规划和指代(用 Visual Primitives 风格),生成式头处理 dense prediction 和动作生成(用 Vision Banana / Flow Matching 风格)。这个混合架构在 VLA 上其实已经有雏形——π0 的"VLM 主干 + FM action expert"就是这个路子,未来可能演化为"VLM 主干 + Visual Primitives 思考 + 生成式 perception head + FM action head"的四段式设计。 长期(5 年+):Level 3 的真正跨模态自由推理需要新架构。可能是 JEPA 路线,可能是 energy-based 方法的复兴,也可能是某种我们还没见过的统一框架。在这个框架里,"用文字思考"和"用图像思考"不再是设计选择,而是模型按任务自适应切换的内部行为。 无论哪条路最终胜出,2026 年 4 月这两篇论文都值得被记住——它们不是某个 benchmark 上的 +X 个点,而是重新定义了 multimodal AI 的 design space。 如果你正在做 VLA、多模态、或者 vision foundation model 的研究,理解这两条路线的对照,可能比任何一篇 SOTA 论文的细节都更重要。 Vision Banana — V. Gabeur, S. Long, S. Peng, et al. Image Generators are Generalist Vision Learners. arXiv:2604.20329. Google DeepMind. 2026.04.23.
- Project: vision-banana.github.io
- 核心贡献:证明生成式预训练等价于通用视觉学习 Thinking with Visual Primitives — R. Lu, Y. Ma, et al. (DeepSeek + Peking University + Tsinghua). Thinking with Visual Primitives. 2026.04.30.
- GitHub: 已删除;PDF 镜像可在 HuggingFace 本文写于 2026 年 5 月。如果你对其中某条路线有不同看法,或者想讨论具体的 VLA 落地路径,欢迎交流。 — EhcoNLP 类比的局限
8. 对 VLA 的具体启示
启示 1:动作 = 对世界的指代
启示 2:视觉编码器选型可能要重新考虑
启示 3:Reference Gap 在机器人上更严重
启示 4:硬件约束驱动的范式选择
9. 几个值得保留的怀疑
对 Vision Banana
对 DeepSeek Visual Primitives
对两者共同的 skepticism
10. 结语:双线收敛?
参考资料索引
核心论文
NodeLinker/deepseek-ai-Thinking-with-Visual-Primitives-deleted-repo 找到
- 核心贡献:提出 Reference Gap 概念和空间 token CoT直接相关的前置工作
VLA 相关参考
范式理论参考
方法论参考