Agent 框架选型的九次推翻 — 从 EvoAgentX 到 scaffolding 本身

用九轮对话寻找一个"理论扎实 + 自进化 + 能沉淀知识"的 agent 框架。每一轮都给出最佳推荐,每一轮都被下一轮推翻。最后我意识到:被推翻的不是某个框架,是这个问题本身。

Ehco · 2026 年 5 月 · 阅读时间约 18 分钟


摘要

我和 AI 来回了九轮,试图选一个 agent 框架。九轮之后我得到的不是答案,是一张领域地图:五种本体论假设、六个未来趋势、一条研究增量。这篇博客记录这次认知迭代的痕迹,最终落到 agent 框架的真正核心理念——scaffolding over modification——再往前推到一个具体的、可证伪的研究方向:用 agent + tool 任务作为"小模型 + 知识外置"的实验台。

如果你也在选 agent 框架,希望这篇能帮你跳过中间七轮。


1. 起点:一个看起来简单的问题

研究者面对 agent 框架时,常见的三条硬性要求:

  1. 理论扎实 —— 有 paper、有理论框架,不是纯工程 demo
  2. 自进化 —— scaffolding 层(prompt / workflow / skill / 架构)随使用变好
  3. 沉淀知识 —— 经验跨 session 累积、可检索、可演化

听起来简单吧。"市面上现在哪个 agent 框架同时满足这三条?"

九轮之后才明白——这个问题问错了


2. 九轮推荐的痕迹

为了让你看到迭代过程本身,把九轮推荐压成一张表:

轮次 当时的"最佳推荐" 当时的理由 后来发现
1 CoALA + Voyager + Letta 经�组合 偏旧。Voyager 是 2023 年的工作
2 EvoAgentX 名字里就有 self-evolving,2.5k stars,配套综述 v0.1 demo 停在 2025-09,本质是 AutoML-for-prompts,不是 lifelong learning
3 DSPy + Letta + HippoRAG 2 Stanford 视角,DSPy 是 ICLR Spotlight 完全没看到中国生态。AgentScope 团队已经把整套东西做出来了
4 AgentScope + ReMe + Trinity-RFT 撞上正解 把"集成"误说成 monorepo——三者其实是同团队的独立项目
5 砍掉 Trinity-RFT 加上 "API 模型、不能训权重" 约束后 RFT 路径不可行 修正方向但没扩展候选
6 单推 ReMe "三条全中、且代码可用" 数据没核实——ReMe 在 BFCL 上提升只有 +2-15%,是温和改进不是革命
7 A-MEM 平推 NeurIPS 2025,自动进化 A-MEM 已经被 D-MEM/Mem0 在 LoCoMo 超越 25+ 分
8 引入 D-MEM、Quality Gating dual-process 2026-03 神经科学新工作 都是研究代码,没有产品形态
9 三层架构(不再单推) 没有单点最优,分层 bet 这一轮的结论看起来终于站得住

每一轮的方法论错误是同一个:在上一轮答案的基础上做局部优化,没有定期回到完整的 SOTA 检索。结果就是每一轮的推荐都比真实 SOTA 落后 6-12 个月。对研究者来说,这是致命的——你拿一个去年的 paper 当起点,中间错过了 3-4 篇关键工作。

如果可以重来,第一轮我应该说:"这个领域 2025-2026 没有稳定的最佳框架,在足够 search 之前不要用'唯一''最佳'这种词,告诉我你的具体场景再来定。"


3. 当框架塌陷后剩下什么:五种本体论假设

九轮推荐都被推翻之后,留下的不是空白——是一张更深的地图。把所有讨论过的框架归约到底,其实是五种不同的本体论假设——对"agent 该如何记忆和进化"的根本回答不一样。

一、认知架构派:记忆是分层模块

二、知识网络派:记忆是动态图

三、生产记忆派:记忆是一个服务

四、编译优化派:agent 是可优化的程序

五、自演化派:agent 重写自己

横向矩阵

流派 代表 理论扎实 自进化 沉淀知识 API 友好 当前可用
认知架构派 Letta ✅✅ ⚠️
知识网络派 A-MEM / D-MEM ✅✅ ✅✅ ✅✅ ⚠️ 研究代码
生产记忆派 Mem0 / ReMe ⚠️ ⚠️ ✅✅ ✅✅ ✅✅
编译优化派 DSPy ✅✅ ⚠️ 编译期
自演化派 ADAS / DGM ✅✅ ✅✅ ⚠️ ⚠️ 研究代码

没有任何一派单独同时拿满所有维度。这才是 2026 年这个领域的真实状态——五个传统还在分裂,没有合一的赢家。


4. Agent 的真正核心:scaffolding over modification

九轮聊完,我才有底气回答一个看起来更基础的问题:agent 框架到底是为什么存在的?

一个常见误区是把 agent 框架的目标说成"提升模型的准确性和效率"。这个表述错在哪里?

把因果方向搞反

LLM 是一个无状态函数——给它输入返回输出,本身不变。Agent 框架做的不是"提升模型",而是在冻结的 LLM 之外构建一个有状态的、能与世界交互的系统

打个比方:你不会说"汽车的目标是提升发动机的性能"。汽车需要发动机,但汽车存在的意义是把人从 A 运到 B。发动机性能在出厂前就定了。LLM 是发动机,agent 框架是汽车

如果只是为了"提升准确性",最直接的方法是换更大的模型——根本不需要 agent 框架。Agent 框架要解决的是单纯换大模型解决不了的问题

LLM 的六个本质局限

LLM 局限 Agent 框架的对应解法
无状态 Memory 系统
无法行动 Tool calling
上下文有限 Context management / RAG
单步推理 ReAct / 多轮规划
静态知识 检索增强 / 网络搜索
不可信验证 Verifier / 多 agent 辩论

把五派重新放在这张表前面看,你会发现每一派其实是对"哪个 LLM 局限最该补"的不同回答。这不是哲学分歧,是工程优先级分歧。

核心理念:scaffolding,不是 modification

Agent 框架的真正核心可以浓缩成一个英文词:scaffolding——脚手架。

不要试图改进 LLM 本身。把 LLM 当成一个固定能力的"思考函数",在它周围搭建脚手架,让这个固定能力涌现出超出单次调用的复杂行为。

支撑这个立场的三个根本判断:

  1. 模型能力短期内不会通过 agent 工程"提升"。GPT-4 就是 GPT-4,单次调用的能力上限不会因为你换框架而改变。Agent 框架能做的是让多次调用的总产出比单次调用大——这是涌现,不是提升

  2. 智能不只在大脑里,也在大脑和环境的交互中。这是 Andy Clark 的 extended mind hypothesis——一个数学家用纸和笔解题,"智能"不是只在大脑里,纸笔扩展了工作记忆。Agent 框架就是给 LLM 一套"纸和笔"

  3. 可靠性来自约束,不来自能力。让 LLM 自己写一段复杂代码可能 70% 正确率。但如果你加上"先写测试,再写代码,跑测试,根据失败修代码"——可靠性能上 90%+。多出来的 20% 不是因为 LLM 变聪明了,是因为流程把它的不可靠性约束在了一个可恢复的循环里

一句话定义

把闭环和 scaffolding 合起来,agent 框架的精确定义可以写成:

Agent 框架的核心理念是:把不变的 LLM 嵌入一个有状态、能行动、能反思、能积累的工程系统中,让模型的固定能力涌现出超出单次调用的复杂行为。

LLM 是大脑,agent 框架是身体。你不会问"汽车的目的是不是让发动机更准确",同样你也不该问"agent 框架的目的是不是让模型更准确"。

agent 框架的真正问题是:给定一颗已经定型的大脑,如何造一具身体让它走出实验室,做点真正的事


5. 未来三年的六个方向

讲未来必须诚实——没人真的知道未来会怎样。能做的是把当前已经显现出方向性的信号列出来,让你自己判断。

趋势一:从"对话型 agent"转向"行动型 agent"

2023-2024 年的 agent 主要还是"和 agent 对话"。2025-2026 年明显的转向是长时间无人监督的自主任务执行——Claude Code、Cursor、Replit Agent、Devin、SWE-Agent。核心转变:从"agent 是个智能助手"到"agent 是个能独立完成任务的数字员工"。

趋势二:multi-agent 成为默认架构

Anthropic 公开他们内部用 multi-agent 做研究(research agent 调用多个子 agent 并行 search)。AgentScope、MetaGPT、AutoGen 都把 multi-agent orchestration 作为核心。未来 agent 的能力不只看单 agent 强不强,看 agent 之间的协议、协作模式、责任划分。

趋势三:memory 从可选变成必备

2024 年大多数 agent 系统没有真正的长期记忆。2026 年开始改变——LoCoMo benchmark、Mem0/A-MEM/D-MEM 这一系列工作的出现,标志着 memory 正在从"加分项"变成"基础设施"。Claude、ChatGPT、Gemini 都上线了原生 memory 功能。这会让 agent 真正具备"个性":同一个框架跑 6 个月之后,因为积累的经验不同,行为会显著分化。

趋势四:从 prompt engineering 转向 system engineering

2023 年大家比谁的 prompt 写得好。2026 年的关注点已经移到整个 agent 系统的工程质量:可观测性、错误恢复、成本控制、多租户隔离、安全沙箱、审计日志。LangSmith、Arize、Helicone 这些 LLM observability 工具的崛起;Anthropic Agent Skills(agentskills.io)成为开放标准;"Eval-driven development" 取代 prompt-driven。

趋势五:垂直化和具身化分流

通用 agent(OpenAI Operator)和垂直专用 agent(医疗、法律、coding、机器人)会越来越分化。Coding agent 已经单独成产业(Cursor、Devin、Cognition、Claude Code)。VLA(Vision-Language-Action)把 agent 推向物理世界。

趋势六:自进化的真正实现还很远

ADAS、DGM 这些工作有 promising signs,但都是研究 demo,没有产品形态。真正的自进化还有三个未解问题:

  1. 奖励信号问题:现实任务大多没有明确 reward
  2. 稳定性问题:自修改的系统很容易越修改越烂(catastrophic drift)
  3. 算力问题:让 meta-agent 探索 agent 空间需要大量 LLM 调用,成本不可控

这个方向是研究的金矿,但不是产品的金矿。如果做研究是正确方向;如果做工程,未来 2-3 年的主流仍然是"人类设计 agent + memory 累积经验"。

一句话押注

把六个趋势串起来,我自己的押注是:

未来三年,agent 不会变得更"聪明",会变得更"靠谱"。

这个 distinction 比任何具体技术都重要。


6. 从"bet 哪个框架"到"bet 研究增量"

九轮之后,如果你逼我给一个具体推荐,我会说:

三层架构 bet

┌────────────────────────────────────────────┐
│  研究增量层(你的工作)                    │
└────────────────────┬───────────────────────┘
                     ↓
┌────────────────────────────────────────────┐
│  执行层 (Execution): AgentScope v2         │
│  ReAct 循环、tool calling、HITL、streaming │
└────────────────────┬───────────────────────┘
                     ↓
┌────────────────────────────────────────────┐
│  记忆层 (Memory): Mem0 + ReMe              │
│  Mem0 做 personal/episodic(LoCoMo SOTA) │
│  ReMe 做 procedural(任务执行强)          │
└────────────────────┬───────────────────────┘
                     ↓
┌────────────────────────────────────────────┐
│  模型层 (Model): API 模型组合              │
└────────────────────────────────────────────┘

这个推荐不是终点

真正的终点是:bet 不在框架,在你自己的研究问题。框架是水电煤,研究问题才是房子。三层架构的价值不在于它最强,而在于对所有可能赢家的兼容性——任何一层有更好的替代品出现,你都能换掉那一层而不丢掉整个工作。

一个具体的研究假设

举一个具体的研究方向作为例子:

用 agent + tool 任务作为"小模型 + 知识外置"的可证伪实验台。

这个假设是这样推出来的——

一个常见的初始想法是做"零知识 reasoning core":一个具零知识但推理能力极强的小模型。但这个命题在自然语言上无法证伪:任何 NL 任务都掺世界知识,"零知识"根本无法干净操作,评估永远糊。

agent + tool 这个设定恰好把知识外置成可见、可控的接口

一个被打掉的细节

顺着这条线,自然会想到再配一个 loss 函数"剥离知识,只保留语义理解和推理"。深查之后必须承认:原理上不存在

神经网络里"知识"和"推理"用的是同一组权重。不是"难分开"——是它们根本就不是两个东西。

这是过去 10 年神经科学和深度学习交叉领域的共识。"知识剥离"这个想法和"把蛋糕的甜味剥离出来留下口感"是同构的——你不能 isolate 一个不作为独立成分存在的东西。

这个 finding 比"找到对的 loss"更重要——它告诉你这个方向应该绕开。省掉的六个月比新做的工作更值钱

test-time compute 那条还活着

去掉"剥离知识"之后,剩下的研究空间在另一个维度:test-time compute 的两个独立轴

理论上对小模型来说,latent space test-time compute 更有意义——它不靠"记住更多事实"(小模型本来就装不下),靠"用更多算力把同样的能力榨出来"。这才是和"小模型 + tools" 真正搭配的方向:

现实的硬度

不要美化这条路:

但作为研究,它满足三个条件:理论有抓手(计算放在哪个空间是可论证的)、可证伪(BFCL/AppWorld 干净指标)、资源可控(消费级显卡 + API 模型即可)。

这就够了。


7. 结语:九轮之后的真信念

九轮讨论之后,我学到的不是哪个框架最好,是问题问得不对

正确的姿态可以归纳为四句话:

  1. 没有一站式答案。五派分立,组合使用,自己动手
  2. Agent 的核心是闭环。趋势是闭环的每一环都在被工程化
  3. 真正应该 bet 的是"对所有可能赢家的兼容性"——分层架构
  4. 但分层架构本身只是水电煤。真正要 bet 的是研究问题

未来三年,agent 框架的赢家可能 2027 年才会出现。在那之前,你需要的不是"赌对赢家",是"保持对所有可能赢家的兼容性"。同时,把研究问题想清楚——比框架重要十倍

九轮之后我对这个领域的态度从"想找一站式答案"变成了"接受没有一站式答案"。这不是失败,是更准的认识。


参考资料

理论与综述

记忆系统

框架与编译优化

自演化

追踪资源