看图思考的七条路:为什么没有最优解

从 Vision Banana 到 Mixture of Reasoning Media,复盘 2026 年 multimodal reasoning 的 design space

Ehco · 2026 年 5 月 · 阅读时间约 22 分钟


摘要

到 2026 年中,"VLM 应该如何完成视觉推理"这个问题已经分裂成至少六条相互独立的技术范式,每一条都有自己的代表工作和拥趸。它们各自宣称解决了"看图思考",但在不同 benchmark、不同任务、不同硬件场景下互有胜负——没有任何一种方法在全部维度上占优

本文做两件事。第一,把这六条路放到同一张地图上比较:核心机制、benchmark 表现、固有局限。第二,论证这种"互相打不死"不是研究界还没想清楚——而是问题本身的几何性质决定了单一范式无解。结论是:Mixture of Reasoning Media(第七条路)——让模型根据当前 sub-operation 自己选思考媒介——才是这个领域的结构性出路。


目录

  1. 引言:单一范式时代的结束
  2. 第一性原理:什么时候才需要"用图思考"
  3. 六条已有路线的全景
  4. 六维 trade-off 大对照
  5. 为什么没有最优解:问题的几何性质
  6. 第七条路:Mixture of Reasoning Media
  7. 仍然值得追的侧向 angle
  8. 结语:从单一范式到 router 学习
  9. 参考资料

1. 引言:单一范式时代的结束

每隔一两年,多模态 AI 都会出现一种"新范式"。2023 年是 BLIP-2 / Flamingo 的 Q-Former 时代,cross-attention 抽 patch features;2024 年是 LLaVA 系直接喂 patch token 主导;2025 年是 reasoning-via-tool-use 抢戏,模型自己 crop 自己看;2026 年开年又一口气冒出两条相反的路——Vision Banana 主张让生成模型完成视觉推理,DeepSeek 主张在文字 chain-of-thought 里嵌空间坐标 token。

如果按"哪种是赢家"的旧叙事看,今年 4 月以来又多了一票候选范式:Mini-o3 长 horizon active perception、CoCoVa 连续 latent 共演化、Pixel Reasoner curiosity-driven RL、FoveateR 非语言 action token……每隔一两个月就有人宣布"我们走出了 thought-with-image 的下一步"。

这些范式没有一个能 dominate。每条路都有自己擅长的 benchmark、不擅长的 benchmark、能跑的硬件预算、不能跑的硬件预算、保留得住的能力、保不住的能力。

这不是研究界还没想清楚,是问题本身的结构决定的。

本文想完成的事情:

  1. 画地图——把目前能见到的六条主要路线放在同一张图上,逐条讲清楚机制和局限
  2. 画坐标系——给出 6 个评估维度,把这六条路在每个维度上的表现摆出来
  3. 得结论——证明这六条路不是互相替代,而是互补关系;继续在单一范式上 push 不会突破 Pareto 前沿;下一步该做的是 Mixture of Reasoning Media(第七条路)——让模型自己根据当前 sub-operation 路由到合适的媒介

读完应该让你不再问"哪条路是对的",而是开始问"什么任务上谁更合适,怎么把它们组合起来"。


2. 第一性原理:什么时候才需要"用图思考"

讨论"看图思考"之前先问一个反过来的问题:什么时候不需要看图思考?

答案是:绝大多数时候

GPT-4V、Gemini、Qwen-VL 这些通用 VLM 在主流 VQA benchmark(OK-VQA、VizWiz、MMBench)上做得不错,它们的工作流很简单——看图(通过 ViT 编码)→ 文字 CoT → 给答案。整个"思考"过程发生在文字侧,图像只在最开头作为输入被消化一次。这套工作流跑得通的原因是:对绝大多数视觉问题,"看图理解 + 文字思考"足够

那什么时候不够?

回到信息论的最深一层——只有当语言对某些信息有不可忽视的投影损失时,思考过程中视觉模态才需要继续参与。具体三类:

语言对视觉信息的三类投影损失 只有这三类操作真正需要"用图思考" 1. 连续量 深度 / 角度 / 位置精度 语言里: "约 2 米" "略偏左" "差不多 30 度" ↑ 全部精度都丢 视觉里: 每个像素一个浮点 毫米级深度 连续可微 2. 多实体格式塔 空间配置 / 群组关系 语言里: "中央偏左那个红的" "前排第三个" "穿条纹的几个人" ↑ 多于 3-4 个就崩 视觉里: 所有候选同时可见 配置直接是表示 无指代歧义 3. 拓扑变换 形变 / 旋转 / 几何操作 语言里: "这个结旋转 90 度" "两个零件能拼上吗" "对称轴在哪" ↑ 几乎没有词汇 视觉里: 几何操作可视化 变换是数据载体 直接计算

任何视觉推理任务,只要不属于这三类,纯文字 CoT 就足够。GPT-4V 在大部分 benchmark 上表现良好不是因为它在"看图思考"——而是因为大部分 benchmark 不属于上面三类。

但当任务属于这三类——counting、geometric reasoning、3D 推理、密集 spatial layout、computer vision benchmark 上的 dense prediction——纯文字 CoT 立刻塌掉。这才是"看图思考"问题真正的需求面

接下来六条路线——本质上就是针对这三类语言瓶颈的不同解法


3. 六条已有路线的全景

六条已有路线的全景 每条路用不同的"思考媒介"攻击不同的语言瓶颈 路 1 · 生成即理解(Vision Banana) 媒介:RGB 图像 · 思考在生成器 latent dynamics 里完成 代表:Vision Banana (2026.04) · Lotus · Marigold · Diception 路 2 · 指代即思考(DeepSeek Spatial Primitives) 媒介:bbox / point token · 思考在 AR token 序列里 + 精确空间锚 代表:DeepSeek Visual Primitives (2026.04) 路 3 · 连续视觉 token AR(COVT) 媒介:~20 个连续 latent token · AR 流嵌入,多 expert 蒸馏出 dense 知识 代表:Chain-of-Visual-Thought(Berkeley, 2025.11) 路 4 · 连续 latent 共演化(CoCoVa) 媒介:连续 latent thought 向量 · 思考是 latent 的多步迭代演化 代表:CoCoVa (2025.11) · MCOUT-Multi · VaLR · Mirage(多模态版 Coconut) 路 5 · 重新看(Active Perception / Mini-o3) 媒介:crop tool call · 思考是"想-看-想-看"循环,ViT 真的重编码 代表:V*/SEAL · ZoomEye · DeepEyes · Pixel Reasoner · Mini-o3 (2025.09) 路 6 · 廉价检索(Learnable Query / Q-Former lineage) 媒介:learnable query 向量 · 思考是从 cached patch features 反复 cross-attention 抽取 代表:BLIP-2 / Flamingo · Cambrian-1 SVA · Sieve(反 re-encoding 派)

下面逐条展开。

3.1 路 1:生成即理解 — Vision Banana

核心思想:把所有视觉任务的输出参数化为 RGB 图像,让生成模型同时是理解模型。深度估计 → 输出彩色 depth visualization;segmentation → 输出彩色 mask;referring expression → 输出"用纯黄色分割滑板"。所有 task-specific 设计被外移到 prompt,模型本身不需要任何架构改动。

思考发生在哪:连续 latent dynamics 中的多步去噪 / 流动。论文的最核心 claim 是:足够强的图像生成器,在生成预训练阶段隐式地学到了"物体真实大小尺度"、"几何"、"深度"等视觉先验,这些先验可以直接驱动理解任务。

实证亮点:Cityscapes mIoU 0.699 超 SAM 3 的 0.652;ReasonSeg gIoU 0.793 超 SAM 3 + Gemini 2.5 Pro 组合;NYU/ETH3D/DIODE/KITTI 上 metric depth δ1 0.929 超 Depth Anything 3,且完全不依赖 camera intrinsics

致命局限:推理成本——多步去噪即使用 consistency model 也要 4-8 步 forward,比 specialist 专用模型贵一个数量级。Faithfulness 也差——思考在生成器 latent 中完成,完全不可读、不可干预

最适合:dense prediction(depth / segmentation / surface normal)、需要连续量精度的 perception。

3.2 路 2:指代即思考 — DeepSeek Spatial Primitives

核心思想:把点坐标和 bounding box 作为推理的最小单元,像文字 token 一样穿插在 chain-of-thought 中。注意这和"输出 bbox"是两码事——传统 grounding 把 bbox 当输出,DeepSeek 把 bbox 当思考过程的一部分:在 CoT 中间,模型直接生成 <box>...</box>,把"中央偏左那个红色物体"换成精确坐标,然后基于坐标继续推理。

三步思考协议:Intent Analysis → Batch Grounding(一次性定位所有候选)→ Statistical Summation。Batch grounding 是关键——避免 sequential enumeration 时的 attention 漂移,类似人类 counting 时"先把候选都圈出来再数"的策略。

思考发生在哪:标准 AR token 序列。没有离开 LLM 范式,但加上了精确空间锚

优势:保留 AR 的所有工程优势——KV cache、CoT 可解释、speculative decoding、distillation 友好。部署成本几乎为零,现有 AR-LLM 基础设施直接复用。

实证亮点:counting 和空间推理 benchmark 上能与 GPT-5.4、Claude Sonnet 4.6、Gemini 3-Flash 持平;视觉 token 预算更小。

局限:表达天花板。点和 bbox 能精确指代刚体目标,但对形变、变化中的对象、抽象关系("两个东西的对称轴")力不从心。这是这条路固有的上限。

最适合:counting、grounding、reference-heavy 的空间推理。

3.3 路 3:连续视觉 token AR — COVT

核心思想:Chain-of-Visual-Thought(COVT, arXiv:2511.19418, Berkeley, 2025.11)走的是 DeepSeek Spatial Primitives 的"AR 流嵌视觉 token"思路,但token 不是离散的 <box> 文字而是连续向量——大约 20 个 latent token,每个编码 2D appearance / 3D geometry / spatial layout / edge structure 的某一面。

思考发生在哪:仍是标准 AR token 序列,但流里穿插的不是 bbox 文字而是连续视觉 token。模型直接在连续视觉 token space 里 reasoning——既不需要路 4(CoCoVa)的 Q-Former 迭代不动点 dynamics,也不需要把连续量符号化(路 2 DeepSeek 的离散瓶颈)。

训练信号:多 expert 蒸馏。每个 token 的目标是重建一组 dense supervision——depth、segmentation、edge、DINO features。这把"连续 token 该编码什么"用具体的 expert 锚住——不再是 outcome RL 的稀疏信号,也不需要 Coconut 风格 curriculum trick。这是这条路在训练上最干净的一点。

优势矩阵——这是为什么这条路被独立列出的关键:

  1. 解决 DeepSeek 的连续性瓶颈——连续 token 能表达深度、角度、形变
  2. 不撞 CoCoVa 的 fixed-point——AR 而非迭代 dynamics,每个新 token 都是独立的 next-token prediction
  3. 算力低——只 20 个 token,不是 RGB 生成、不是 ViT 重编码
  4. 训练信号清晰——多 expert 蒸馏不稀疏,可以 stage-wise 训练
  5. 部分 faithfulness——可 optionally decode 到 dense prediction 做可视化("看每个 token 学到了什么")

局限: - 20 个 token 是固定预算,长尾任务的复杂视觉信息可能装不下 - 需要预先准备 depth / seg / edge / DINO 的 expert encoder——基础设施成本不为零 - 作为 plug-in 加到 Qwen2.5-VL / LLaVA 上验证,还没有 base model 量级的实证 - 跨 task 泛化:训练数据外的视觉概念能否被自动 encode 进 token 不清楚

实证:在 Qwen2.5-VL 和 LLaVA 上 plug-in,CV-Bench / MMVP / RealWorldQA / MMStar / WorldMedQA / HRBench 上 +3-16%。

为什么这条路重要:在 6 维 trade-off 表上看(下一节会展开),COVT 是所有六条路中负面项最少的一条——没有任何一维彻底失败,三维 ✓、三维部分。它同时拿到了连续性(vs DeepSeek)、避开了 fixed-point(vs CoCoVa)、避开了重编码成本(vs Mini-o3)、避开了完全的分辨率瓶颈(因为 token 来自多 expert 而不是单一 ViT patch)、还有部分 faithfulness。

但 COVT 仍然不是终点——它在每一维上都不是 dominant,长 horizon 上仍然受 20-token 预算限制,faithfulness 不及离散 bbox。所以即使 COVT 是当前最平衡的一条路,它仍然不破坏 mixture 的论点——它是 mixture 视角下的一个候选 primitive,不是替代方案。

最适合:dense perception 任务(CV-Bench / RealWorldQA 这类需要几何 + 语义混合理解的)、需要连续量但不能付生成代价的中等深度推理。

3.4 路 4:连续 latent 共演化 — CoCoVa

核心思想:把 Coconut(Hao et al., Meta 2024,文字版连续 chain-of-thought)拓展到多模态。每个推理步上,文字 hidden state + 图像 feature 在共享连续 latent 里联合演化——不强制每步离散化为 token。CoCoVa 的具体机制是 LQ-Former(Q-Former 风格 cross-attention)迭代地 refine 一组 latent thought vectors,用 diffusion image-recon loss + symmetric InfoNCE + LM loss 联合训练。

思考发生在哪:连续 latent space 的迭代演化。

直觉吸引力:理论上同时解决三类语言瓶颈——latent 容量大、连续可微、能承载几何 / 形变 / 多实体格式塔的任意混合。是看起来"最完美"的路线

致命问题——这是这条路最重要的部分,也是这篇博客想强调的:

  1. Fixed-point 收敛——CoCoVa 自己 Figure 8 显示 latent thought 的 displacement 单调减小,第 4 步后趋近 0。也就是说加 reasoning 步数没有用——这是连续 dynamics 倾向于不动点的固有问题,深度均衡网络、looped transformers 都观察到。
  2. 算力 vs 表达 trade-off 不可破解——真正完整的 patch token 共演化(256-2880 patch × 1024-4096 dim,每步全更新)算不动;CoCoVa 的妥协是用 Q-Former 压缩成几十个 query token,这就丢失了原图信息的大部分
  3. Faithfulness 严格变差——离散 CoT 已经被证明经常不忠实于真实计算,连续 latent 没有可读表面。CoCoVa 用 diffusion decoder 重建做缓解,但这是被训练出的重建,不是真正的内省
  4. 训练信号稀疏 + curriculum 必需——Capabilities and Fundamental Limits of Latent CoT(arXiv:2602.01148)形式化证明了 latent CoT 有 exploration-execution tradeoff,且直接训练理论上不可行——必须 curriculum。Coconut 在 GSM8K 上只有 34.1%(标准 CoT 远高),多模态版会原样继承。

判决:这条路看似完美,实际上是被否决的。如果你只看 CoCoVa 的论文标题和摘要,会觉得它解决了所有问题;细读它自己的 Figure 8 和 ablation,会发现它撞了三个结构性的墙。

值得被记住的原因:它是过去 18 个月里最 tempting的范式——现在还有团队在前赴后继地试,以为换个训练 trick 就能突破。但 fixed-point 是 dynamical system 的固有性质,不是训练的事。

3.5 路 5:重新看 — Active Perception / Mini-o3

核心思想:让 VLM 像人一样反复回去看图——每次看由当前推理状态驱动。模型在 CoT 中发出 crop / zoom / re-encode 的指令,ViT 真的在 crop 上重新做一次 forward,新 vision tokens 接回 token 流,思考继续。这是真正的"think by re-looking"——和 DeepSeek 输出 bbox 但不重编码不同,这条路真的在重新感知。

进化脉络——从 V* 到 Mini-o3 是单调的"让 LLM 越来越自主":

Active Perception 的进化时间轴 "看哪"的决定权从外挂模块移到 LLM 自己 V* / SEAL 2023.12 外挂 VWSM 单轮粗→细 决策不在 LLM Chain-of-Spot 2024 早期 SFT on GPT-4 ROI 两步 crop ZoomEye 2024.11 免训练树搜索 +15-17% HR-Bench 证明免训可行 DeepEyes 2025.05 纯 RL,无 SFT tool use 自发涌现 RL 可学习性 Pixel Reasoner 2025.05 curiosity reward V*Bench 84% 解决 textual bias Mini-o3 2025.09 SFT 分桶 + GRPO over-turn masking cap=6 → 30+ turn 机制层面五篇都一样:emit 区域 → ViT 重编码 crop → 新 tokens 拼回 → 继续推理。 没人在范式上跳出过 V* 的模板。

思考发生在哪:标准 AR token 序列 + 多次 ViT forward。faithfulness 高(每个 crop 都是可读的 bbox token,可审计)。

优势:解决信息保留(每次 crop 重置分辨率瓶颈)、faithfulness(bbox 可读)、训练信号(outcome RL + 工具 reward 直接可用)、长 horizon(Mini-o3 已经做出 30+ turn 的实证)。

致命局限:算力——Mini-o3 上 30+ turn 意味着 30+ 次 ViT forward,端侧部署不现实。机制层面所有工作都在 V 的同一模板上做迭代——没人在范式上跳出过*。

最适合:高分辨率 VQA、小目标 search、需要 5+ 步推理的 long-horizon 视觉问题。

3.6 路 6:廉价检索 — Q-Former / Learnable Query

核心思想:图像被 ViT 一次性编码成 patch features 后存起来。推理过程中,一组可学习 query 通过 cross-attention 从这些 cached features 里抽取信息,结果接回 reasoning trace。没有 ViT 重算,只多一次 cross-attention,便宜得多。

思考发生在哪:query 在 cached feature space 上的迭代检索。

直觉吸引力:完美对应"用图思考"的字面意思——图像 feature 一直在场,模型每步可以问图任意问题。算力上是 active perception 的 1/10 甚至更低。

致命局限分辨率瓶颈。一旦图像被 ViT 编成 N 个 patch token,patch 内的细节就被压缩掉了——4K 图被 256 patch 编码意味着每个 patch 覆盖约 256×256 像素,小目标的 50×50 像素细节早就被 averaged out。后续无论 query 多 adaptive、reasoning state 多复杂,抽取的信息上限就是 patch 已经保留的——没法恢复 ViT 编码时丢失的内容。

这条路在 VBench 这种小目标 benchmark 上结构性输给 re-encoding 派。要重得 ZoomEye 那种"免训练 +17%"的效果,learnable query 派几乎做不到——因为它们不在重新编码*。

附带损害——从 attention 热力图获得 faithfulness 这件事靠不住:Jain & Wallace 2019 / Wiegreffe & Pinter 2019 已经证明 attention 权重和真实 feature 重要性不可靠对应;多头多层聚合的歧义;attention sink 干扰。热力图给人看着像可解释,实际上不是

最适合:高层语义理解、不需要小目标 / 高分辨率细节的 VQA、long-context 视频理解(每帧重编码代价太大)。


4. 六维 trade-off 大对照

把上面六条路放到 6 个维度上一起评估:

  1. 信息保留——能否保留小目标 / 高分辨率细节
  2. 算力——推理时 ViT forward / token 预算
  3. Faithfulness——思考过程是否可读、可审计
  4. 训练信号——是否有清晰的非稀疏监督
  5. 长 horizon——能否 scale 到 5+ 步推理
  6. 连续性——能否表达连续量 / 形变 / 几何变换

六条路 × 六个维度 没有任何一行能在六个维度上拿满 范式 信息保留小目标细节 算力推理成本 Faithfulness可审计 训练信号非稀疏监督 长 horizon5+ 步 连续性几何/形变 路 1 Vision Banana 生成 / RGB 输出 路 2 Spatial Primitives bbox / point token 路 3 COVT 连续视觉 token AR 路 4 CoCoVa latent 共演化 路 5 Active Perception crop + 重编码 路 6 Learnable Query cross-attn 抽取 关键观察: 每条路都至少缺一个维度。COVT 是负面项最少的(0 个 ✗),但仍非 dominant。Pareto 前沿非平凡。 trade-off 互补:路 1/4 强连续性弱 horizon;路 2/5 强 horizon 弱连续性;路 3 居中。

关键观察

这种互补但不可合并的形态是关键诊断。即使 COVT 把"无 ✗"做到了,它仍只是 Pareto 上的另一点,不是最优点——这反而强化了下面的论点。


5. 为什么没有最优解:问题的几何性质

为什么会出现"六条路互相打不死"?这不是研究界还没想清楚——是问题本身的几何性质决定的。

回顾第 2 节的第一性原理:视觉推理需要解决三类语言瓶颈——连续量、多实体格式塔、拓扑变换。

观察这三类瓶颈对思考媒介的需求是互相冲突的:

没有任何一种媒介在三类瓶颈上同时是最优的

最后一条最重要:COVT 的存在证明可以同时部分解决三类瓶颈但同时也证明"部分"是当前架构的硬上限——20 token 预算 + 多 expert 蒸馏所能装下的信息有限,超过它就要付别的代价。

数学上可以这样理解:思考媒介构成一个有限维度向量,每个维度对应一种语言瓶颈的解决能力。Pareto 前沿是非平凡的——每个媒介在不同维度上有不同权重,没有一个媒介支配其他媒介。COVT 是目前 Pareto 前沿上最靠中心的一点,但它仍在前沿上——不在前沿之外。

这是结构性结论思考媒介本身就是有 trade-off 的对象,单一媒介无解。继续在 6 条路的任意一条上 push,你能优化的是该路的特定 trade-off 配置,不会突破 Pareto 前沿


6. 第七条路:Mixture of Reasoning Media

如果单一媒介无解——那答案是让模型自己根据当前 sub-operation 路由到合适的媒介

类比 MoE。Dense vs sparse 模型的争论在 2022 年被 MoE 终结——不是 dense 赢、sparse 赢,是 router 决定每个 token 路由到哪个 expert。视觉推理也一样:没有最优媒介,只有最优 router

具体长什么样:

Mixture of Reasoning Media 六个 reasoning primitive + 学到的 router 推理状态 + Learned Router 每步选下一个 primitive ① 文字 CoT 符号 / 逻辑 / 计算 默认廉价路径 ② Spatial Primitive bbox / point 指代 / counting ③ Continuous Token COVT 风格 AR 连续 dense 表示 ④ Learnable Query cross-attn 抽取 廉价语义检索 ⑤ Re-encode Crop ViT 重 forward 精细 resolution 查询 ⑥ Generated Sketch Vision Banana 风格 几何 / 形变探索 router 按当前 sub-operation 选 primitive:counting → ②;depth → ⑥;long-horizon search → ⑤;语义检索 → ④;连续 dense 表示 → ③

核心 claim:每个 primitive 单独使用时都有失败 regime;组合后失败 regime 互不重叠——counting 用 ② spatial primitive、depth 估计用 ⑥ generated sketch、long-horizon search 用 ⑤ re-encode、廉价语义检索用 ④ learnable query、连续 dense 表示用 ③ COVT 风格 token。模型自己选。

注意 ③ continuous visual token 这个 primitive 的引入是这篇博客修订后新增的——COVT 论文证明这个 primitive 训练上比 Vision Banana 廉价、比 CoCoVa 稳定、比 Spatial Primitive 表达力强,是 mixture 中目前最该被率先纳入的候选。

这件事现在有人做吗

没有。这是这篇博客最重要的论点。

按我做完研究 agent 的尽职调查,目前没人构建过同时支持 4-6 种 reasoning primitive 且通过学到的 router 路由的 VLM。最接近的工作至多组合 2 种:

没人做过 4-6 种 primitive 的真正集成。COVT 的存在让 mixture 变得更可行——它证明了 ③ 这个 primitive 在 plug-in 模式下能 work,意味着剩下的工作是把更多 primitive 接到同一个 router 上。

为什么没人做

我能想到的原因:

  1. 工程量大——一个模型同时支持 6 种动作,需要 Q-Former、ViT 重编码 head、生成 head、bbox decoder、连续 token decoder、文字 head 都集成,没人想做这种"六合一"
  2. Router 的训练信号不清楚——纯 outcome RL 上 6 个 primitive 的 credit assignment 是噩梦
  3. 学术激励倒挂——投单一新机制比投"组合现有机制 + 学 router"容易发顶会
  4. 范式分裂——做 Vision Banana 的人和做 DeepSeek Spatial Primitives 的人不在同一个 community,没人有理由把它们缝起来

但这些都是社会原因,不是技术原因。技术上没有任何东西阻止 mixture 工作

人脑就是这么干的

最后一个论点。神经科学层面,人脑对视觉推理的处理本来就是 mixture

这不是说"AI 应该模仿大脑"——是说生物进化在面对同样的问题时,独立收敛到了 mixture 解。这是一个 strong existence proof:mixture 是这个问题真实的解


7. 仍然值得追的侧向 angle

不是路 1-5 的衍生,但都值得在写"thought-with-image"时被记住:

7.1 多层 ViT 查询

ViT 有 L 层,目前所有方法只用最后一层 patch token。但早层 = 局部纹理,晚层 = 语义——不同推理子操作需要不同层。

让 query / reasoning state 自己选层:counting 用早层(边缘清晰),semantic VQA 用晚层。几乎没人正经做。这是个相对廉价的修改——不需要 re-encoding,只需要 cache 多层 features,按需 query。

7.2 Test-time encoder adaptation

人看一张陌生图时会调整自己的视觉系统。VLM 推理时 briefly fine-tune 一个 LoRA 或 visual prompt 在当前图上,再开始推理。Test-time training 在 NLP 上有迹象(TTT、Diffusion Test-Time)。视觉推理这块几乎是空白。Cost 高但对单图深度分析有可能 dramatic gain。

7.3 结构化中间表示:scene graph / 3D / 程序化

直觉:raster pixels / patch features 也许就是错的思考底物。换成结构化中间表示——scene graph、3D 表示、视觉 DSL(ViperGPT / VisProg 的延伸)。faithfulness 强、算力小,但只在能被分解成结构化任务的领域有效——通用 VQA 上输给 dense feature。

这一类是"领域窄但本域强"。和 mixture 互补——mixture 关心通用性,结构化关心深度。

7.4 Retrievability-friendly 视觉编码器

ViT 是被 CLIP / DINO 训出来的——这两个目标都没有"我的 feature 应该方便后续 reasoning 检索"这一条。如果有个原生设计"被 reasoning query 检索友好"的视觉编码器,learnable query 派的天花板会被抬高。目前没人做——这是 base model 量级的项目,但回报可能极大。

7.5 World model 底层

最 ambitious:真正的 thought-with-image 不是 thought-with-image,是 thought-with-internal-world-model。图像是 evidence,进入 world model,推理在 world model 的 latent state 上做。

这是 LeCun 的 JEPA + world model program、Genie / Sora 的长期 bet。和 thought-with-image 已经不是一类问题——它把"想"重新定义到了"模拟世界"。说到这一层基本就跨进 VLA / embodied AI 了。


8. 结语:从单一范式到 router 学习

回过头看这篇文章想说的事,可以浓缩成三条:

第一:到 2026 年中,"看图思考"的 design space 已经分裂成至少六条独立路线,没有任何一种在 6 个评估维度上 dominate——即使是最平衡的 COVT 也没有突破 Pareto 前沿。继续追"哪条路是对的"是错的问题。

第二:这种"互相打不死"不是研究界还没想清楚——是问题本身的几何性质决定的。三类语言瓶颈(连续量 / 多实体格式塔 / 拓扑变换)对思考媒介的需求互相冲突,没有单一媒介能同时是三者最优解。Pareto 前沿是非平凡的。

第三:结构性出路是 Mixture of Reasoning Media(第七条路)——让模型同时拥有 6 种 primitive,由学到的 router 决定每一步用哪个。这是这个领域当前最值得做、且没人在做的事。COVT 的实证(plug-in 6 种 ① + ③ 组合就能拿 +3-16%)是 mixture 方向的一个早期 evidence——把更多 primitive 接进 router,gain 应该是叠加的。

如果把整个 thought-with-image 的研究史压缩成一句话,可能是这样的:2023-2024 年,我们在探索单一媒介的设计空间;2025-2026 年,我们发现这个空间是 Pareto 前沿非平凡的;2027 年开始,问题应该变成怎么训出能在媒介之间路由的模型——视觉推理领域的 MoE 时刻


参考资料

六条路核心论文

  1. Vision Banana — V. Gabeur, S. Long, S. Peng, et al. Image Generators are Generalist Vision Learners. arXiv:2604.20329. Google DeepMind. 2026.04.23.
  2. DeepSeek Visual Primitives — R. Lu, Y. Ma, et al. Thinking with Visual Primitives. DeepSeek + Peking + Tsinghua. 2026.04.30.
  3. COVT — Z. Qin, et al. Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens. arXiv:2511.19418. UC Berkeley. 2025.11.
  4. CoCoVa — Y. Ma, X. Zhou, J. Song, J. Yan. CoCoVa: Chain of Continuous Vision-Language Thought. arXiv:2511.02360. CAS / UCAS. 2025.11.
  5. Coconut — S. Hao, et al. Training Large Language Models to Reason in a Continuous Latent Space. Meta. 2024.
  6. V* / SEAL — P. Wu, S. Xie. V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs. arXiv:2312.14135. CVPR 2024.
  7. DeepEyes — Z. Zheng, et al. DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning. arXiv:2505.14362. 2025.05.
  8. Pixel Reasoner — A. Wang, et al. Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning. arXiv:2505.15966. 2025.05.
  9. ZoomEye — H. Shen, et al. ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-based Image Exploration. arXiv:2411.16044. 2024.11.
  10. Mini-o3 — H. Lai, et al. Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search. arXiv:2509.07969. 2025.09.

Latent CoT 理论参考

  1. Capabilities and Fundamental Limits of Latent Chain-of-Thought. arXiv:2602.01148. 2026.
  2. Do Latent-CoT Models Think Step-by-Step? arXiv:2602.00449. 2026.
  3. MCOUT-MultiMultimodal Chain of Continuous Thought. arXiv:2508.12587. 2025.08.
  4. VaLRVision-aligned Latent Reasoning. arXiv:2602.04476. 2026.02.
  5. MirageMachine Mental Imagery. arXiv:2506.17218. 2025.06.

Active Perception 邻近工作

  1. DualFocus — W. Cao, et al. arXiv:2402.14767. 2024.
  2. Chain-of-Spot — Z. Liu, et al. arXiv:2403.12966. 2024.
  3. FoveateRFoveated Reasoning. arXiv:2604.21079. 2026.
  4. S-BOEDActive Reasoning VLM via Sequential Bayesian Experimental Design. arXiv:2605.01345. 2026.
  5. SieveCached-Embedding Retrieval for VLM Reasoning. arXiv:2603.14117. 2026.
  6. Visual Sketchpad — Y. Hu, et al. Sketching as a Visual Chain of Thought for Multimodal Language Models. NeurIPS 2024.

范式理论参考

  1. Attention is not explanation — S. Jain, B. Wallace. NAACL 2019.
  2. Attention is not not explanation — S. Wiegreffe, Y. Pinter. EMNLP 2019.
  3. CoT faithfulness — T. Lanham, et al. Measuring Faithfulness in Chain-of-Thought Reasoning. Anthropic. 2023.
  4. Cambrian-1 — S. Tong, et al. Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs. NYU. 2024.
  5. JEPA / V-JEPA-2 — Y. LeCun, et al. A Path Towards Autonomous Machine Intelligence. 2022 onwards.

前置博客


本文写于 2026 年 5 月。如果你对 mixture-of-reasoning-media 有具体落地想法,或对哪条路有不同看法,欢迎讨论。

— Ehco