看图思考的七条路:为什么没有最优解
从 Vision Banana 到 Mixture of Reasoning Media,复盘 2026 年 multimodal reasoning 的 design space
Ehco · 2026 年 5 月 · 阅读时间约 22 分钟
摘要
到 2026 年中,"VLM 应该如何完成视觉推理"这个问题已经分裂成至少六条相互独立的技术范式,每一条都有自己的代表工作和拥趸。它们各自宣称解决了"看图思考",但在不同 benchmark、不同任务、不同硬件场景下互有胜负——没有任何一种方法在全部维度上占优。
本文做两件事。第一,把这六条路放到同一张地图上比较:核心机制、benchmark 表现、固有局限。第二,论证这种"互相打不死"不是研究界还没想清楚——而是问题本身的几何性质决定了单一范式无解。结论是:Mixture of Reasoning Media(第七条路)——让模型根据当前 sub-operation 自己选思考媒介——才是这个领域的结构性出路。
目录
- 引言:单一范式时代的结束
- 第一性原理:什么时候才需要"用图思考"
- 六条已有路线的全景
- 六维 trade-off 大对照
- 为什么没有最优解:问题的几何性质
- 第七条路:Mixture of Reasoning Media
- 仍然值得追的侧向 angle
- 结语:从单一范式到 router 学习
- 参考资料
1. 引言:单一范式时代的结束
每隔一两年,多模态 AI 都会出现一种"新范式"。2023 年是 BLIP-2 / Flamingo 的 Q-Former 时代,cross-attention 抽 patch features;2024 年是 LLaVA 系直接喂 patch token 主导;2025 年是 reasoning-via-tool-use 抢戏,模型自己 crop 自己看;2026 年开年又一口气冒出两条相反的路——Vision Banana 主张让生成模型完成视觉推理,DeepSeek 主张在文字 chain-of-thought 里嵌空间坐标 token。
如果按"哪种是赢家"的旧叙事看,今年 4 月以来又多了一票候选范式:Mini-o3 长 horizon active perception、CoCoVa 连续 latent 共演化、Pixel Reasoner curiosity-driven RL、FoveateR 非语言 action token……每隔一两个月就有人宣布"我们走出了 thought-with-image 的下一步"。
但这些范式没有一个能 dominate。每条路都有自己擅长的 benchmark、不擅长的 benchmark、能跑的硬件预算、不能跑的硬件预算、保留得住的能力、保不住的能力。
这不是研究界还没想清楚,是问题本身的结构决定的。
本文想完成的事情:
- 画地图——把目前能见到的六条主要路线放在同一张图上,逐条讲清楚机制和局限
- 画坐标系——给出 6 个评估维度,把这六条路在每个维度上的表现摆出来
- 得结论——证明这六条路不是互相替代,而是互补关系;继续在单一范式上 push 不会突破 Pareto 前沿;下一步该做的是 Mixture of Reasoning Media(第七条路)——让模型自己根据当前 sub-operation 路由到合适的媒介
读完应该让你不再问"哪条路是对的",而是开始问"什么任务上谁更合适,怎么把它们组合起来"。
2. 第一性原理:什么时候才需要"用图思考"
讨论"看图思考"之前先问一个反过来的问题:什么时候不需要看图思考?
答案是:绝大多数时候。
GPT-4V、Gemini、Qwen-VL 这些通用 VLM 在主流 VQA benchmark(OK-VQA、VizWiz、MMBench)上做得不错,它们的工作流很简单——看图(通过 ViT 编码)→ 文字 CoT → 给答案。整个"思考"过程发生在文字侧,图像只在最开头作为输入被消化一次。这套工作流跑得通的原因是:对绝大多数视觉问题,"看图理解 + 文字思考"足够。
那什么时候不够?
回到信息论的最深一层——只有当语言对某些信息有不可忽视的投影损失时,思考过程中视觉模态才需要继续参与。具体三类:
任何视觉推理任务,只要不属于这三类,纯文字 CoT 就足够。GPT-4V 在大部分 benchmark 上表现良好不是因为它在"看图思考"——而是因为大部分 benchmark 不属于上面三类。
但当任务属于这三类——counting、geometric reasoning、3D 推理、密集 spatial layout、computer vision benchmark 上的 dense prediction——纯文字 CoT 立刻塌掉。这才是"看图思考"问题真正的需求面。
接下来六条路线——本质上就是针对这三类语言瓶颈的不同解法。
3. 六条已有路线的全景
下面逐条展开。
3.1 路 1:生成即理解 — Vision Banana
核心思想:把所有视觉任务的输出参数化为 RGB 图像,让生成模型同时是理解模型。深度估计 → 输出彩色 depth visualization;segmentation → 输出彩色 mask;referring expression → 输出"用纯黄色分割滑板"。所有 task-specific 设计被外移到 prompt,模型本身不需要任何架构改动。
思考发生在哪:连续 latent dynamics 中的多步去噪 / 流动。论文的最核心 claim 是:足够强的图像生成器,在生成预训练阶段隐式地学到了"物体真实大小尺度"、"几何"、"深度"等视觉先验,这些先验可以直接驱动理解任务。
实证亮点:Cityscapes mIoU 0.699 超 SAM 3 的 0.652;ReasonSeg gIoU 0.793 超 SAM 3 + Gemini 2.5 Pro 组合;NYU/ETH3D/DIODE/KITTI 上 metric depth δ1 0.929 超 Depth Anything 3,且完全不依赖 camera intrinsics。
致命局限:推理成本——多步去噪即使用 consistency model 也要 4-8 步 forward,比 specialist 专用模型贵一个数量级。Faithfulness 也差——思考在生成器 latent 中完成,完全不可读、不可干预。
最适合:dense prediction(depth / segmentation / surface normal)、需要连续量精度的 perception。
3.2 路 2:指代即思考 — DeepSeek Spatial Primitives
核心思想:把点坐标和 bounding box 作为推理的最小单元,像文字 token 一样穿插在 chain-of-thought 中。注意这和"输出 bbox"是两码事——传统 grounding 把 bbox 当输出,DeepSeek 把 bbox 当思考过程的一部分:在 CoT 中间,模型直接生成 <box>...</box>,把"中央偏左那个红色物体"换成精确坐标,然后基于坐标继续推理。
三步思考协议:Intent Analysis → Batch Grounding(一次性定位所有候选)→ Statistical Summation。Batch grounding 是关键——避免 sequential enumeration 时的 attention 漂移,类似人类 counting 时"先把候选都圈出来再数"的策略。
思考发生在哪:标准 AR token 序列。没有离开 LLM 范式,但加上了精确空间锚。
优势:保留 AR 的所有工程优势——KV cache、CoT 可解释、speculative decoding、distillation 友好。部署成本几乎为零,现有 AR-LLM 基础设施直接复用。
实证亮点:counting 和空间推理 benchmark 上能与 GPT-5.4、Claude Sonnet 4.6、Gemini 3-Flash 持平;视觉 token 预算更小。
局限:表达天花板。点和 bbox 能精确指代刚体目标,但对形变、变化中的对象、抽象关系("两个东西的对称轴")力不从心。这是这条路固有的上限。
最适合:counting、grounding、reference-heavy 的空间推理。
3.3 路 3:连续视觉 token AR — COVT
核心思想:Chain-of-Visual-Thought(COVT, arXiv:2511.19418, Berkeley, 2025.11)走的是 DeepSeek Spatial Primitives 的"AR 流嵌视觉 token"思路,但token 不是离散的 <box> 文字而是连续向量——大约 20 个 latent token,每个编码 2D appearance / 3D geometry / spatial layout / edge structure 的某一面。
思考发生在哪:仍是标准 AR token 序列,但流里穿插的不是 bbox 文字而是连续视觉 token。模型直接在连续视觉 token space 里 reasoning——既不需要路 4(CoCoVa)的 Q-Former 迭代不动点 dynamics,也不需要把连续量符号化(路 2 DeepSeek 的离散瓶颈)。
训练信号:多 expert 蒸馏。每个 token 的目标是重建一组 dense supervision——depth、segmentation、edge、DINO features。这把"连续 token 该编码什么"用具体的 expert 锚住——不再是 outcome RL 的稀疏信号,也不需要 Coconut 风格 curriculum trick。这是这条路在训练上最干净的一点。
优势矩阵——这是为什么这条路被独立列出的关键:
- 解决 DeepSeek 的连续性瓶颈——连续 token 能表达深度、角度、形变
- 不撞 CoCoVa 的 fixed-point——AR 而非迭代 dynamics,每个新 token 都是独立的 next-token prediction
- 算力低——只 20 个 token,不是 RGB 生成、不是 ViT 重编码
- 训练信号清晰——多 expert 蒸馏不稀疏,可以 stage-wise 训练
- 部分 faithfulness——可 optionally decode 到 dense prediction 做可视化("看每个 token 学到了什么")
局限: - 20 个 token 是固定预算,长尾任务的复杂视觉信息可能装不下 - 需要预先准备 depth / seg / edge / DINO 的 expert encoder——基础设施成本不为零 - 作为 plug-in 加到 Qwen2.5-VL / LLaVA 上验证,还没有 base model 量级的实证 - 跨 task 泛化:训练数据外的视觉概念能否被自动 encode 进 token 不清楚
实证:在 Qwen2.5-VL 和 LLaVA 上 plug-in,CV-Bench / MMVP / RealWorldQA / MMStar / WorldMedQA / HRBench 上 +3-16%。
为什么这条路重要:在 6 维 trade-off 表上看(下一节会展开),COVT 是所有六条路中负面项最少的一条——没有任何一维彻底失败,三维 ✓、三维部分。它同时拿到了连续性(vs DeepSeek)、避开了 fixed-point(vs CoCoVa)、避开了重编码成本(vs Mini-o3)、避开了完全的分辨率瓶颈(因为 token 来自多 expert 而不是单一 ViT patch)、还有部分 faithfulness。
但 COVT 仍然不是终点——它在每一维上都不是 dominant,长 horizon 上仍然受 20-token 预算限制,faithfulness 不及离散 bbox。所以即使 COVT 是当前最平衡的一条路,它仍然不破坏 mixture 的论点——它是 mixture 视角下的一个候选 primitive,不是替代方案。
最适合:dense perception 任务(CV-Bench / RealWorldQA 这类需要几何 + 语义混合理解的)、需要连续量但不能付生成代价的中等深度推理。
3.4 路 4:连续 latent 共演化 — CoCoVa
核心思想:把 Coconut(Hao et al., Meta 2024,文字版连续 chain-of-thought)拓展到多模态。每个推理步上,文字 hidden state + 图像 feature 在共享连续 latent 里联合演化——不强制每步离散化为 token。CoCoVa 的具体机制是 LQ-Former(Q-Former 风格 cross-attention)迭代地 refine 一组 latent thought vectors,用 diffusion image-recon loss + symmetric InfoNCE + LM loss 联合训练。
思考发生在哪:连续 latent space 的迭代演化。
直觉吸引力:理论上同时解决三类语言瓶颈——latent 容量大、连续可微、能承载几何 / 形变 / 多实体格式塔的任意混合。是看起来"最完美"的路线。
致命问题——这是这条路最重要的部分,也是这篇博客想强调的:
- Fixed-point 收敛——CoCoVa 自己 Figure 8 显示 latent thought 的 displacement 单调减小,第 4 步后趋近 0。也就是说加 reasoning 步数没有用——这是连续 dynamics 倾向于不动点的固有问题,深度均衡网络、looped transformers 都观察到。
- 算力 vs 表达 trade-off 不可破解——真正完整的 patch token 共演化(256-2880 patch × 1024-4096 dim,每步全更新)算不动;CoCoVa 的妥协是用 Q-Former 压缩成几十个 query token,这就丢失了原图信息的大部分。
- Faithfulness 严格变差——离散 CoT 已经被证明经常不忠实于真实计算,连续 latent 没有可读表面。CoCoVa 用 diffusion decoder 重建做缓解,但这是被训练出的重建,不是真正的内省。
- 训练信号稀疏 + curriculum 必需——Capabilities and Fundamental Limits of Latent CoT(arXiv:2602.01148)形式化证明了 latent CoT 有 exploration-execution tradeoff,且直接训练理论上不可行——必须 curriculum。Coconut 在 GSM8K 上只有 34.1%(标准 CoT 远高),多模态版会原样继承。
判决:这条路看似完美,实际上是被否决的。如果你只看 CoCoVa 的论文标题和摘要,会觉得它解决了所有问题;细读它自己的 Figure 8 和 ablation,会发现它撞了三个结构性的墙。
值得被记住的原因:它是过去 18 个月里最 tempting的范式——现在还有团队在前赴后继地试,以为换个训练 trick 就能突破。但 fixed-point 是 dynamical system 的固有性质,不是训练的事。
3.5 路 5:重新看 — Active Perception / Mini-o3
核心思想:让 VLM 像人一样反复回去看图——每次看由当前推理状态驱动。模型在 CoT 中发出 crop / zoom / re-encode 的指令,ViT 真的在 crop 上重新做一次 forward,新 vision tokens 接回 token 流,思考继续。这是真正的"think by re-looking"——和 DeepSeek 输出 bbox 但不重编码不同,这条路真的在重新感知。
进化脉络——从 V* 到 Mini-o3 是单调的"让 LLM 越来越自主":
思考发生在哪:标准 AR token 序列 + 多次 ViT forward。faithfulness 高(每个 crop 都是可读的 bbox token,可审计)。
优势:解决信息保留(每次 crop 重置分辨率瓶颈)、faithfulness(bbox 可读)、训练信号(outcome RL + 工具 reward 直接可用)、长 horizon(Mini-o3 已经做出 30+ turn 的实证)。
致命局限:算力——Mini-o3 上 30+ turn 意味着 30+ 次 ViT forward,端侧部署不现实。机制层面所有工作都在 V 的同一模板上做迭代——没人在范式上跳出过*。
最适合:高分辨率 VQA、小目标 search、需要 5+ 步推理的 long-horizon 视觉问题。
3.6 路 6:廉价检索 — Q-Former / Learnable Query
核心思想:图像被 ViT 一次性编码成 patch features 后存起来。推理过程中,一组可学习 query 通过 cross-attention 从这些 cached features 里抽取信息,结果接回 reasoning trace。没有 ViT 重算,只多一次 cross-attention,便宜得多。
思考发生在哪:query 在 cached feature space 上的迭代检索。
直觉吸引力:完美对应"用图思考"的字面意思——图像 feature 一直在场,模型每步可以问图任意问题。算力上是 active perception 的 1/10 甚至更低。
致命局限:分辨率瓶颈。一旦图像被 ViT 编成 N 个 patch token,patch 内的细节就被压缩掉了——4K 图被 256 patch 编码意味着每个 patch 覆盖约 256×256 像素,小目标的 50×50 像素细节早就被 averaged out。后续无论 query 多 adaptive、reasoning state 多复杂,抽取的信息上限就是 patch 已经保留的——没法恢复 ViT 编码时丢失的内容。
这条路在 VBench 这种小目标 benchmark 上结构性输给 re-encoding 派。要重得 ZoomEye 那种"免训练 +17%"的效果,learnable query 派几乎做不到——因为它们不在重新编码*。
附带损害——从 attention 热力图获得 faithfulness 这件事靠不住:Jain & Wallace 2019 / Wiegreffe & Pinter 2019 已经证明 attention 权重和真实 feature 重要性不可靠对应;多头多层聚合的歧义;attention sink 干扰。热力图给人看着像可解释,实际上不是。
最适合:高层语义理解、不需要小目标 / 高分辨率细节的 VQA、long-context 视频理解(每帧重编码代价太大)。
4. 六维 trade-off 大对照
把上面六条路放到 6 个维度上一起评估:
- 信息保留——能否保留小目标 / 高分辨率细节
- 算力——推理时 ViT forward / token 预算
- Faithfulness——思考过程是否可读、可审计
- 训练信号——是否有清晰的非稀疏监督
- 长 horizon——能否 scale 到 5+ 步推理
- 连续性——能否表达连续量 / 形变 / 几何变换
关键观察:
- 没有任何一行能在所有 6 个维度上拿满
- 路 3(COVT)是负面项最少的一条——0 个 ✗、3 个 ✓、3 个 —。但它在每个 ✓ 维度上都不是 dominant(信息保留 / faithfulness / 长 horizon 都只是"部分"),所以仍未突破 Pareto 前沿
- 路 1(Vision Banana)和路 5(Active Perception)的 trade-off 互补——前者擅长连续 dense prediction 但贵;后者擅长 long-horizon 离散 reasoning 但牺牲连续性
- 路 2(Spatial Primitives)在算力 / faithfulness / 训练 / horizon 上几乎全胜,但被连续性卡死——counting 它是王,几何变换它就废
- 路 4(CoCoVa)是"看似最优实际最差"——连续性好但其它五个维度全是问题
- 路 6(Learnable Query)便宜但被信息保留卡死
这种互补但不可合并的形态是关键诊断。即使 COVT 把"无 ✗"做到了,它仍只是 Pareto 上的另一点,不是最优点——这反而强化了下面的论点。
5. 为什么没有最优解:问题的几何性质
为什么会出现"六条路互相打不死"?这不是研究界还没想清楚——是问题本身的几何性质决定的。
回顾第 2 节的第一性原理:视觉推理需要解决三类语言瓶颈——连续量、多实体格式塔、拓扑变换。
观察这三类瓶颈对思考媒介的需求是互相冲突的:
- 连续量 → 媒介必须连续、高精度、保持物理量级 → 倾向生成式 / latent / 连续 token
- 多实体格式塔 → 媒介必须能精确指代多个独立对象 → 倾向 spatial primitive / re-encoding
- 拓扑变换 → 媒介必须支持形变、旋转、组合操作 → 倾向生成式 / 程序化
没有任何一种媒介在三类瓶颈上同时是最优的:
- 选连续 latent(CoCoVa)→ 解决了 1 和 3,但 2 失效(latent 中没有可指代的离散对象);且撞 fixed-point
- 选 spatial primitive(DeepSeek)→ 解决了 2,但 1 和 3 表达不出来
- 选 RGB 生成(Vision Banana)→ 解决了 1 和 3,但算力崩;勉强能解 2 但要画 mask
- 选 re-encode(Mini-o3)→ 解决了 1 和 2 的精度,但 3 表达不出来
- 选 learnable query(Q-Former)→ 在 cached feature 容许的范围内便宜地解三类,但天花板被首次编码锁死
- 选连续视觉 token AR(COVT)→ 同时部分解决了三类,没有任何一类彻底失败——但每一类都只是"部分",因此仍不是任何一类的最优解
最后一条最重要:COVT 的存在证明可以同时部分解决三类瓶颈,但同时也证明"部分"是当前架构的硬上限——20 token 预算 + 多 expert 蒸馏所能装下的信息有限,超过它就要付别的代价。
数学上可以这样理解:思考媒介构成一个有限维度向量,每个维度对应一种语言瓶颈的解决能力。Pareto 前沿是非平凡的——每个媒介在不同维度上有不同权重,没有一个媒介支配其他媒介。COVT 是目前 Pareto 前沿上最靠中心的一点,但它仍在前沿上——不在前沿之外。
这是结构性结论:思考媒介本身就是有 trade-off 的对象,单一媒介无解。继续在 6 条路的任意一条上 push,你能优化的是该路的特定 trade-off 配置,不会突破 Pareto 前沿。
6. 第七条路:Mixture of Reasoning Media
如果单一媒介无解——那答案是让模型自己根据当前 sub-operation 路由到合适的媒介。
类比 MoE。Dense vs sparse 模型的争论在 2022 年被 MoE 终结——不是 dense 赢、sparse 赢,是 router 决定每个 token 路由到哪个 expert。视觉推理也一样:没有最优媒介,只有最优 router。
具体长什么样:
核心 claim:每个 primitive 单独使用时都有失败 regime;组合后失败 regime 互不重叠——counting 用 ② spatial primitive、depth 估计用 ⑥ generated sketch、long-horizon search 用 ⑤ re-encode、廉价语义检索用 ④ learnable query、连续 dense 表示用 ③ COVT 风格 token。模型自己选。
注意 ③ continuous visual token 这个 primitive 的引入是这篇博客修订后新增的——COVT 论文证明这个 primitive 训练上比 Vision Banana 廉价、比 CoCoVa 稳定、比 Spatial Primitive 表达力强,是 mixture 中目前最该被率先纳入的候选。
这件事现在有人做吗
没有。这是这篇博客最重要的论点。
按我做完研究 agent 的尽职调查,目前没人构建过同时支持 4-6 种 reasoning primitive 且通过学到的 router 路由的 VLM。最接近的工作至多组合 2 种:
- Mini-o3 = ① + ⑤(文字 CoT + crop)
- Pixel Reasoner = ① + ⑤(zoom 是 re-encode 的形式)
- Visual Sketchpad = ① + ⑥ 的早期形态
- DeepSeek Visual Primitives = ① + ②
- COVT = ① + ③(plug-in 到 Qwen2.5-VL / LLaVA 上的 ① + ③ 组合)
没人做过 4-6 种 primitive 的真正集成。COVT 的存在让 mixture 变得更可行——它证明了 ③ 这个 primitive 在 plug-in 模式下能 work,意味着剩下的工作是把更多 primitive 接到同一个 router 上。
为什么没人做
我能想到的原因:
- 工程量大——一个模型同时支持 6 种动作,需要 Q-Former、ViT 重编码 head、生成 head、bbox decoder、连续 token decoder、文字 head 都集成,没人想做这种"六合一"
- Router 的训练信号不清楚——纯 outcome RL 上 6 个 primitive 的 credit assignment 是噩梦
- 学术激励倒挂——投单一新机制比投"组合现有机制 + 学 router"容易发顶会
- 范式分裂——做 Vision Banana 的人和做 DeepSeek Spatial Primitives 的人不在同一个 community,没人有理由把它们缝起来
但这些都是社会原因,不是技术原因。技术上没有任何东西阻止 mixture 工作。
人脑就是这么干的
最后一个论点。神经科学层面,人脑对视觉推理的处理本来就是 mixture:
- Dorsal stream(背侧通路)处理 where / how——空间位置、运动、动作规划
- Ventral stream(腹侧通路)处理 what——物体识别、分类
- Foveal vs peripheral vision——中央凹高分辨率精确识别(路 5 Active Perception 的对应),边缘视野廉价覆盖(路 6 Learnable Query 的对应)
- Saccade(眼跳)——由当前推理任务驱动地 reposition fovea(active perception 的 biological prior)
- Mental imagery——内部生成视觉场景(路 1 Vision Banana 的 biological prior)
- Symbolic reasoning + spatial language——文字 CoT + spatial primitive 的 biological 对应
- Latent perceptual scaffold——视觉皮层连续 feature map 上的快速操作(路 3 COVT 的 biological prior)
这不是说"AI 应该模仿大脑"——是说生物进化在面对同样的问题时,独立收敛到了 mixture 解。这是一个 strong existence proof:mixture 是这个问题真实的解。
7. 仍然值得追的侧向 angle
不是路 1-5 的衍生,但都值得在写"thought-with-image"时被记住:
7.1 多层 ViT 查询
ViT 有 L 层,目前所有方法只用最后一层 patch token。但早层 = 局部纹理,晚层 = 语义——不同推理子操作需要不同层。
让 query / reasoning state 自己选层:counting 用早层(边缘清晰),semantic VQA 用晚层。几乎没人正经做。这是个相对廉价的修改——不需要 re-encoding,只需要 cache 多层 features,按需 query。
7.2 Test-time encoder adaptation
人看一张陌生图时会调整自己的视觉系统。VLM 推理时 briefly fine-tune 一个 LoRA 或 visual prompt 在当前图上,再开始推理。Test-time training 在 NLP 上有迹象(TTT、Diffusion Test-Time)。视觉推理这块几乎是空白。Cost 高但对单图深度分析有可能 dramatic gain。
7.3 结构化中间表示:scene graph / 3D / 程序化
直觉:raster pixels / patch features 也许就是错的思考底物。换成结构化中间表示——scene graph、3D 表示、视觉 DSL(ViperGPT / VisProg 的延伸)。faithfulness 强、算力小,但只在能被分解成结构化任务的领域有效——通用 VQA 上输给 dense feature。
这一类是"领域窄但本域强"。和 mixture 互补——mixture 关心通用性,结构化关心深度。
7.4 Retrievability-friendly 视觉编码器
ViT 是被 CLIP / DINO 训出来的——这两个目标都没有"我的 feature 应该方便后续 reasoning 检索"这一条。如果有个原生设计"被 reasoning query 检索友好"的视觉编码器,learnable query 派的天花板会被抬高。目前没人做——这是 base model 量级的项目,但回报可能极大。
7.5 World model 底层
最 ambitious:真正的 thought-with-image 不是 thought-with-image,是 thought-with-internal-world-model。图像是 evidence,进入 world model,推理在 world model 的 latent state 上做。
这是 LeCun 的 JEPA + world model program、Genie / Sora 的长期 bet。和 thought-with-image 已经不是一类问题——它把"想"重新定义到了"模拟世界"。说到这一层基本就跨进 VLA / embodied AI 了。
8. 结语:从单一范式到 router 学习
回过头看这篇文章想说的事,可以浓缩成三条:
第一:到 2026 年中,"看图思考"的 design space 已经分裂成至少六条独立路线,没有任何一种在 6 个评估维度上 dominate——即使是最平衡的 COVT 也没有突破 Pareto 前沿。继续追"哪条路是对的"是错的问题。
第二:这种"互相打不死"不是研究界还没想清楚——是问题本身的几何性质决定的。三类语言瓶颈(连续量 / 多实体格式塔 / 拓扑变换)对思考媒介的需求互相冲突,没有单一媒介能同时是三者最优解。Pareto 前沿是非平凡的。
第三:结构性出路是 Mixture of Reasoning Media(第七条路)——让模型同时拥有 6 种 primitive,由学到的 router 决定每一步用哪个。这是这个领域当前最值得做、且没人在做的事。COVT 的实证(plug-in 6 种 ① + ③ 组合就能拿 +3-16%)是 mixture 方向的一个早期 evidence——把更多 primitive 接进 router,gain 应该是叠加的。
如果把整个 thought-with-image 的研究史压缩成一句话,可能是这样的:2023-2024 年,我们在探索单一媒介的设计空间;2025-2026 年,我们发现这个空间是 Pareto 前沿非平凡的;2027 年开始,问题应该变成怎么训出能在媒介之间路由的模型——视觉推理领域的 MoE 时刻。
参考资料
六条路核心论文
- Vision Banana — V. Gabeur, S. Long, S. Peng, et al. Image Generators are Generalist Vision Learners. arXiv:2604.20329. Google DeepMind. 2026.04.23.
- DeepSeek Visual Primitives — R. Lu, Y. Ma, et al. Thinking with Visual Primitives. DeepSeek + Peking + Tsinghua. 2026.04.30.
- COVT — Z. Qin, et al. Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens. arXiv:2511.19418. UC Berkeley. 2025.11.
- CoCoVa — Y. Ma, X. Zhou, J. Song, J. Yan. CoCoVa: Chain of Continuous Vision-Language Thought. arXiv:2511.02360. CAS / UCAS. 2025.11.
- Coconut — S. Hao, et al. Training Large Language Models to Reason in a Continuous Latent Space. Meta. 2024.
- V* / SEAL — P. Wu, S. Xie. V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs. arXiv:2312.14135. CVPR 2024.
- DeepEyes — Z. Zheng, et al. DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning. arXiv:2505.14362. 2025.05.
- Pixel Reasoner — A. Wang, et al. Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning. arXiv:2505.15966. 2025.05.
- ZoomEye — H. Shen, et al. ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-based Image Exploration. arXiv:2411.16044. 2024.11.
- Mini-o3 — H. Lai, et al. Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search. arXiv:2509.07969. 2025.09.
Latent CoT 理论参考
- Capabilities and Fundamental Limits of Latent Chain-of-Thought. arXiv:2602.01148. 2026.
- Do Latent-CoT Models Think Step-by-Step? arXiv:2602.00449. 2026.
- MCOUT-Multi — Multimodal Chain of Continuous Thought. arXiv:2508.12587. 2025.08.
- VaLR — Vision-aligned Latent Reasoning. arXiv:2602.04476. 2026.02.
- Mirage — Machine Mental Imagery. arXiv:2506.17218. 2025.06.
Active Perception 邻近工作
- DualFocus — W. Cao, et al. arXiv:2402.14767. 2024.
- Chain-of-Spot — Z. Liu, et al. arXiv:2403.12966. 2024.
- FoveateR — Foveated Reasoning. arXiv:2604.21079. 2026.
- S-BOED — Active Reasoning VLM via Sequential Bayesian Experimental Design. arXiv:2605.01345. 2026.
- Sieve — Cached-Embedding Retrieval for VLM Reasoning. arXiv:2603.14117. 2026.
- Visual Sketchpad — Y. Hu, et al. Sketching as a Visual Chain of Thought for Multimodal Language Models. NeurIPS 2024.
范式理论参考
- Attention is not explanation — S. Jain, B. Wallace. NAACL 2019.
- Attention is not not explanation — S. Wiegreffe, Y. Pinter. EMNLP 2019.
- CoT faithfulness — T. Lanham, et al. Measuring Faithfulness in Chain-of-Thought Reasoning. Anthropic. 2023.
- Cambrian-1 — S. Tong, et al. Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs. NYU. 2024.
- JEPA / V-JEPA-2 — Y. LeCun, et al. A Path Towards Autonomous Machine Intelligence. 2022 onwards.
前置博客
- 本文是 生成 vs 指代:2026 年视觉推理的范式分叉 的延伸思考。如果你是第一次接触 Vision Banana 和 DeepSeek 的对照框架,建议先读那一篇。
本文写于 2026 年 5 月。如果你对 mixture-of-reasoning-media 有具体落地想法,或对哪条路有不同看法,欢迎讨论。
— Ehco