Notes on AI research, multimodal reasoning, and agent systems.
复盘 2026 年 multimodal reasoning 的五条范式、六维 trade-off,以及为什么 Mixture of Reasoning Media 才是结构性出路
工业派定义"LLM 控制 control flow"是 agent;经典派要求 runtime reward / 持续学习 / 内部目标。两个共名异义。把它们搁同一张桌子上对质,才知道今天的 LLM agents 站在哪条线之上、哪条线之下
从约束最优化视角理解 CPT、用 pass@k × σ × ρ 决定方法象限、辨清工业主流 vs 学术前沿,最后聊 MoE Upcycling 的真正机制
用九轮对话寻找一个理论扎实、能自进化、能沉淀知识的 agent 框架,最后发现被推翻的不是某个框架,是把这个问题问成"哪个框架"本身
从 Vision Banana 到 Thinking with Visual Primitives,谈多模态推理的两条未来路线