Agent 这个词在 2026 年指向两个不同的东西
工业派把 agent 定义为"一种部署模式:LLM 控制 control flow"。经典派把 agent 定义为"相对于环境与性能度量的实体"。两者共名异义。Anthropic 的 workflow-vs-agent 准则只解决了工业派那半边——经典派的天花板还没动。
Ehco · 2026 年 5 月 · 阅读时间约 16 分钟
摘要
最近有朋友问我"agent 的核心是什么"。第一反应我用了一个汽车比喻:LLM 是发动机,agent 是车,用户是驾驶员,环境是世界。
这个比喻有个错位——在汽车里驾驶员决定去哪,但在 agent 里决定去哪的是 LLM 自己。这一刻我意识到,"agent"这个词在 2026 年的语义已经分裂成两个不同的东西,而我们大部分人——包括写框架的、写 paper 的、写博客的——都在含糊地混用它们。
这篇文章把这两个定义拉到同一张桌子上对质:
- 工业派的答案——Anthropic 给了 2026 年最清爽的判定:workflow 是代码定义路径,agent 是 LLM 动态决定路径。"控制权归属"是关键,和工具、记忆、规划都无关
- 经典派的答案——Russell & Norvig、Sutton & Barto、Wooldridge、Schmidhuber 这四个老定义检视一下,你会发现按经典标准,今天的 LLM agents 没一个算 agent
- 张力——为什么没法 unify:两边在测量不同的东西
- 比"列组件"更有用的拆解——不要再问"agent 该有哪些组件",要问"agency 安放在哪里"
- 五条核心洞见——给你拿走
读完之后你不会得到一个"agent 的标准定义",因为它不存在。你会得到一张地图:知道哪条边界是工业派的、哪条边界是经典派的、自己在押哪边的注。
1. 起点:你有没有想过这个词出了问题
让我们做个小实验。下面五个东西,哪些是 agent?
- ChatGPT 的 Code Interpreter——LLM 写 Python,沙盒里跑,看结果,再写
- 一个 Zapier 流水线——"收到邮件 → 提取金额 → 录入 Notion"
- Claude Code——读你的代码库、改文件、跑测试、根据结果修代码
- AlphaGo——感知棋盘、选动作、得到胜负反馈、改进 policy
- 一个温控器——温度低于 20 度就开热泵
直觉上,3 是 agent,2 不是。但 1 是吗?4 算吗?5 在 1995 年的 AI 教科书里就是经典 agent 的入门例子。
如果你能给一个把这五个清晰分类的判定准则——你已经领先了行业里 80% 的人。因为这个准则不存在。
不存在的原因是:"agent"在 2026 年指向两个不同的东西。一个来自 1995 年的多智能体系统传统,一个来自 2023 年的 LLM 工具调用工程。它们碰巧都用了同一个词。
2. 工业派的答案:control flow 归属权
工业界 2024-2026 年最 rigorous 的定义来自 Anthropic 2024 年 12 月的博客 Building Effective Agents:
Workflows are systems where LLMs and tools are orchestrated through predefined code paths. Agents are systems where LLMs dynamically direct their own processes and tool usage, maintaining control over how they accomplish tasks.
翻译成一个判定准则:
代码决定下一步 → workflow;LLM 决定下一步 → agent。
这条准则的好处是它和工具、记忆、规划都无关。我们扫了一遍 13 个生产框架(Anthropic / OpenAI Swarm / LangGraph / AutoGen / CrewAI / MetaGPT / AgentScope / DSPy / Letta / smolagents / Devin / Pydantic-AI / Manus),抽出每家的核心抽象:
| 普适性 | 现象 |
|---|---|
| ✅ 100% 共识 | loop——所有 13 个框架都把迭代作为定义性特征。没有 loop 就不是 agent |
| ❌ 不普适 | tool use——CrewAI / MetaGPT / LangGraph 不需要工具也能称为 agent |
| ❌ 不普适 | memory——只有 Letta 把 memory 当核心,其他 12 家都是"可选的外部状态" |
| ❌ 不普适 | 多 agent / 反思 / 规划——都有一些框架不要 |
所以纠正我之前给朋友的那个回答——我说 agent = LLM + tools + 反馈循环 + 状态。研究下来,只有 loop 是真核心,其他三个都是 nice-to-have。
更尖锐的判定准则是 Anthropic 那条的逆否——"LLM 能不能拒绝系统设计者期待的下一步?" 能 → agent;不能 → workflow。
回头看第 1 节的五个例子:
| 例子 | LLM 控制下一步? | 工业派判定 |
|---|---|---|
| ChatGPT Code Interpreter | ✅ LLM 决定下一段代码 | agent |
| Zapier 流水线 | ❌ 路径写死 | workflow |
| Claude Code | ✅ LLM 决定改哪个文件、跑哪个测试 | agent |
| AlphaGo | ✅(在 RL 意义上) | agent |
| 温控器 | ❌ 阈值规则 | 不是 agent |
这是工业派的清爽答案。
3. 经典派的答案:四个老定义的检视
但事情没结束。Russell & Norvig、Sutton & Barto、Wooldridge、Schmidhuber 不会同意上面这个判定。
他们有四把不同的尺子。我们用 Claude Code(工业派眼中无可争议的 agent)去测一下:
尺子一:Russell & Norvig(AIMA, 1995-2020)
An agent is a function that maps percepts to actions, and a rational agent selects an action that is expected to maximize its performance measure.
经典 AI 教科书的定义。要点:percept→action 函数 + 环境 + 外部 performance measure。
Claude Code 满足吗?percept→action 满足。环境满足(文件系统 + shell + 你的指令)。但 performance measure——什么在驱动它的下一个 token?是训练时的 RLHF objective。推理时没有 performance measure 在评判它。它执行的是一个固定的 next-token 概率分布。
Stuart Russell 自己 2023 年在参议院作证时说:"With LLMs, we don't even know what their objectives are."——这不是修辞,按 AIMA 的定义这就是 agent 资格不全。
尺子二:Sutton & Barto(RL, 2018)
A reward signal defines the goal in a reinforcement learning problem. The agent's sole objective is to maximize the total reward it receives over the long run.
RL 教科书。要点:reward 是 constitutive 的。没有 reward 就没有 agent。
Claude Code 推理时有 reward 吗?没有。RLHF 的 reward 只在训练时存在。所以按 Sutton & Barto,Claude Code 在你电脑上跑的时候是个固定的 policy 在跑,不是 agent。
Sutton 和 David Silver 2025 年在 The Era of Experience 里把这个观点彻底化:人类数据训练的 LLM 是死路一条,真正的 agent 必须在持续经验流中通过 grounded reward 不断改进。LLMs "lack the essential mechanism — continual learning from experience — that defines flexible, goal-driven intelligence."
尺子三:Wooldridge(多智能体系统经典,1995-2002)
An agent is a system situated in some environment that is capable of autonomous action in this environment in order to meet its design objectives.
四个性质:autonomy + reactivity + pro-activeness + social ability。
Claude Code 满足几个?
- reactivity:✅ 响应工具输出
- pro-activeness:⚠️ 部分。它的"主动性"是 prompt 注入的目标在驱动;它没有内部维持的 intention。你关掉 session 它就忘了想做什么
- autonomy:⚠️ 弱。autonomy 在 Wooldridge 那里要求对内部状态有控制,能跨 session 维持目标和承诺。LLM-in-ReAct 没有跨 session 状态
- social ability:⚠️ 部分。能和人类聊,但没有形式化的 agent 通信语言(KQML/FIPA-ACL 那种带 speech-act 语义的)
四个性质,全勤的没有,及格的两个。
尺子四:Schmidhuber(Gödel Machine, 2003-2007)
A self-referential problem solver that rewrites any part of its own code as soon as it has found a proof that the rewrite is useful.
Schmidhuber 的最强 agent 标准:可证明的 self-modification。
Claude Code 改自己吗?不改权重。它有时候会改自己的 system prompt 或 skills——但那都是 scaffolding 层,不是 agent 本体。Sakana AI 的 Darwin Gödel Machine 2025 年试着把 Gödel Machine 思想搬到 LLM-stack——但他们也只在 scaffolding 上做演化,LLM 权重照样冻结。
综合:四把尺子下,Claude Code 全军覆没
| 尺子 | 核心要求 | LLM-in-ReAct 满足吗 |
|---|---|---|
| Russell & Norvig | 外部 performance measure | ❌ 推理时无 |
| Sutton & Barto | runtime reward | ❌ 训练时才有 |
| Wooldridge | autonomy + persistent intention | ⚠️ 弱 |
| Schmidhuber | 可证明 self-modification | ❌ 不改权重 |
这不是字面游戏。它预测一个具体的天花板——靠 scaffolding 永远跨不过 continual experience-driven adaptation 这条线。这条线正是 2026 年三个前沿要打破的位置(第 6 节会讲)。
4. 张力:为什么没法 unify
很多人会想——一定有人写了一篇 paper,把经典定义和 LLM 时代定义合并起来吧?
我搜过。没有。
不是没人想干,是这件事在原则上做不到。两边在测量不同的东西:
| 经典派 | 工业派 | |
|---|---|---|
| 定义类型 | 规范性(normative) | 操作性(operational) |
| 定义 anchor | 环境 + 性能度量 | 部署模式(loop + control flow) |
| 时间尺度 | 跨 episode、跨生命 | 单次 task、单 session |
| 学习是否必备 | 是(RL 派、Wooldridge) | 否 |
| 用途 | 理论范畴 | 工程区分 |
经典派想要一个理论范畴,能容纳"会从经验里改进的实体"——所以他们要 reward、要 persistent intention、要 self-modification。
工业派想要一个工程区分,能告诉团队"这个产品该做成 workflow 还是 agent"——所以他们只关心 LLM 是不是控制了 control flow。
Anthropic 的 workflow-vs-agent 准则是工业派最 rigorous 的尝试,但它根本不试图回答经典派的问题。它是在工业派内部画线,不在经典派的疆域里画线。
诚实的姿态:在 2026 年说"agent"的时候,明确你说的是哪一种。
- LLM agent(操作派 / Anthropic / 工业)= LLM 在 loop 里控制 control flow
- agent(规范派 / R&N / Sutton)= 在环境中追求性能度量、能从经验改进的实体
这两个词将来会分化。我赌操作派的"LLM agent"会保留这个词——因为他们在卖产品,市场份额大;规范派最后会用"autonomous learning system"或者别的什么术语区分自己。这是语义经济学的常规结局。
5. 比"列组件"更有用的拆解:agency 安放在哪里
到这里,列组件——loop / tools / memory / planning / reflection——已经解释不了任何流派分歧了。所有人都列得出来。
更尖锐的问题是:你把 agency 安放在哪里?
研究下来 10 个流派,按"agency 的位置"可以归到四个互斥的押注上:
这四个押注基本不兼容。每个押注都给你一些东西、放弃另一些:
- 押内部:得到工程上简洁、empirical 强;放弃理论扎实、放弃可解释、放弃 continual learning
- 押结构:得到模块化、可推理、可演化;放弃简洁、容易"把盒子拼起来叫认知"
- 押耦合:得到深刻的哲学位置;放弃可工程化(FEP 被批不可证伪)
- 押信号:得到 agency 的硬定义;放弃在没有 reward 的开放任务上做事的可能
研究人员应该明确知道自己在押哪个,而不是嘴上说"我们综合"——综合通常意味着没押注。
6. 五条核心洞见
把上面四节浓缩成五条 takeaway。
洞见一:loop 是 agent 唯一被普遍同意的本质特征
跨 13 个生产框架,只有 loop 是 100% 共识。tool use 不普适,memory 不普适,planning 不普适。
写 agent 的人脑子里应该有一条线:没有 loop 不是 agent,loop 之外都是装饰。这意味着如果你在做一个一次性 LLM 调用包了几个工具的东西——它是工具调用,不是 agent。如果你的"agent"实质是个被人类按住每一步决策的助手——它是 chatbot,不是 agent。
洞见二:Anthropic 的判定准则比"是否带工具"清爽
代码决定下一步 → workflow;LLM 决定下一步 → agent。
这条准则不关心你有没有工具、有没有记忆、是不是多轮。它关心控制权归属。
实操上还有个更尖锐的逆否:LLM 能不能拒绝系统设计者期待的下一步?能 → agent;不能 → workflow。这条比"是否带 tool"少 10 个反例。
洞见三:经典 AI 不会把今天的 LLM agents 叫做 agent——这预测一个硬天花板
| 经典定义 | LLM agent 缺什么 |
|---|---|
| Russell & Norvig | 推理时无 performance measure 在驱动 |
| Sutton & Barto | 推理时无 runtime reward |
| Wooldridge | autonomy 弱(无跨 session persistent intention)、无形式化 ACL |
| Schmidhuber | 不改自己权重 |
这不是迂腐。它预测一个具体的硬天花板:靠 scaffolding 跨不过 continual experience-driven adaptation。
如果你的研究问题是"怎么让 agent 跨过这条线"——那你的工作不在 Frame 5(LLM-tool-loop)的内部,而是在攻击 Frame 5 本身。
洞见四:2026 年三个前沿都在攻击 scaffolding 本身
我上一篇博客主张过"scaffolding over modification"——把 LLM 当固定函数,外面搭脚手架。这是当前 SOTA 立场。但 2026 年三个前沿都在踢这条腿:
| 前沿 | 攻击的位置 | 代表工作 |
|---|---|---|
| Self-modification | "scaffolding 应该可演化" | Sakana DGM(arXiv:2505.22954),ADAS |
| Agentic-RL | "LLM 不该是固定函数,权重应端到端训练为多轮 policy" | arXiv:2509.02547,arXiv:2510.01132 |
| Context-as-substrate | "loop 才是次要的,context curriculum 才是 agency 所在" | Agentic Context Engineering (arXiv:2510.04618) |
scaffolding-over-modification 是当下对的——但不是终点。如果你做研究,应该想清楚自己押哪个反例。
洞见五:先选 agency 的位置,再选组件
不要再问"agent 该有哪些组件"——这个问题不区分流派。
要问:你把 agency 安放在哪里?
- 安在模型里 → 你押 LLM-tool-loop / agentic-RL,组件是"更大的模型 + 更好的 RL"
- 安在脚手架里 → 你押 CoALA / DGM / context-engineering,组件是"模块化记忆 + 自修改 + context 演化"
- 安在 agent-环境耦合里 → 你押 JEPA / FEP,组件是"学习世界模型 + 规划"
- 安在优化信号里 → 你押 BDI / RL,组件是"reward 设计 + commitment 机制"
这四个押注的组件清单完全不同。先选押注,再选组件。反过来你永远做不到一致的东西。
7. 给读者的话
这篇博客没有给你"agent 的标准定义"——因为那个定义不存在,至少 2026 年不存在。
它给了你一张更有用的东西:一张地图。
知道工业派的边界画在哪里(control flow 归属权)、经典派的边界画在哪里(reward / autonomy / self-modification)、以及当前 SOTA 落在两条边界中间的什么位置(满足工业派 ✅、不满足经典派 ❌)。
还知道 2026 年的研究前沿正在朝经典派那条边界推进——self-modification 在打 Schmidhuber 那条线、agentic-RL 在打 Sutton 那条线、context-as-substrate 在打 LeCun 那条线。
你下一次说"我们要做一个 agent"的时候,自己心里能区分:
- 我说的是工业派 agent(控制 control flow),还是经典派 agent(从经验改进)?
- 我把 agency 安放在哪里——模型里、结构里、耦合里、还是优化信号里?
- 我的研究增量是在 Frame 5 内部做工程,还是在攻击 Frame 5 本身?
回答清楚这三个问题,你已经领先 80% 在用这个词的人。
附:研究方法和限制
这篇博客的素材来自一次对 18 篇 2024-2026 surveys / position papers + 13 个生产框架文档 + 4 本经典 AI 教材的并行扫描。原始 research 报告存在我的 ~/research/2026-05-08-agent-core/ 下。
诚实的限制:
- AIMA(Russell & Norvig)和 Wooldridge 1995 的引文是从二手 snippet 聚合的,PDF 直接 fetch 在沙箱里被拒。引文表述是学术界共识的标准 rendering,但不是逐字逐页核对的
- Darwin Gödel Machine 在 SWE-bench 20% → 50% 的数字来自二手报告,未独立核实原 paper
- 没系统覆盖中文学术圈对 agent 定义的批评(清华 AIR / 上海 AI Lab 等)
- 没读 Searle / Dennett / Brooks 这些更哲学的位置——可能漏了一个"行为派 / 无表征派"的 frame
- SOTA 截止 2026-05-08,之后的工作不在覆盖范围
会让我推翻这篇主要结论的观察:
- 如果 2027 年 Sutton 或 LeCun 公开承认 LLM-tool-loop 是合法 agent——那经典派那条边界就软化了
- 如果 agentic-RL / DGM / context-engineering 三条腿全部停滞,纯 scaffolding 仍然主导——那洞见四错了
- 如果未来的 taxonomy paper 提出比"agency 位置"更好的拆解轴——那洞见五要更新
引用
- Anthropic, Building Effective AI Agents (Dec 2024) — anthropic.com
- Sumers, Yao, Narasimhan, Griffiths, Cognitive Architectures for Language Agents (CoALA) — arXiv:2309.02427
- Silver & Sutton, Welcome to the Era of Experience (2025) — DeepMind PDF
- Russell & Norvig, Artificial Intelligence: A Modern Approach, 4th ed Ch.2 — aima.cs.berkeley.edu
- Wooldridge & Jennings, Intelligent Agents: Theory and Practice (1995)
- Sutton & Barto, Reinforcement Learning: An Introduction, 2nd ed (2018)
- Schmidhuber, Gödel Machines — idsia.ch
- LeCun, A Path Towards Autonomous Machine Intelligence (2022) — OpenReview
- Zhang et al., Darwin Gödel Machine (2025) — arXiv:2505.22954
- Agentic RL Survey — arXiv:2509.02547
- Agentic Context Engineering — arXiv:2510.04618
- Karpathy, Year in Review 2025 — karpathy.bearblog.dev
- AI Agents vs Agentic AI: A Conceptual Taxonomy — arXiv:2505.10468
- Sketch.dev, Unreasonable Effectiveness of an LLM Agent Loop — sketch.dev