智能系统的设计之道(七)
想,然后做:Agent 行动的四种进阶
摘要
前几篇,我们聊过 Agent 怎么感知、怎么记忆、怎么推理。但推理本身不改变世界——真正让 Agent 有用的,是行动:调用工具、执行操作、对现实产生影响。本文沿着一条行动能力的进阶之路展开:ReAct(边想边做)、规划—执行(先想再做)、工具编排(调度能力)、自适应策略(让策略进化),并给出“行动是 Agent 与世界的对话”这一收束。
ReAct:边想边做
最简单的行动模式,是把思考与行动编织成微循环:先想“我还缺什么信息”,然后去调用工具拿信息,观察结果,再进入下一轮思考。这就是 ReAct——思考、行动、观察,循环往复,直到证据足够,给出结论。
它的设计哲学是认知的具身化:思考不应该在大脑里空转,而要在与世界的互动中展开。就像医生看病,不是坐在诊室里凭空推断,而是开检查单、看报告、再下诊断。边想边做的好处是灵活——每一步都基于最新的事实;代价是长任务容易“漂移”,走一步看一步,全局感弱,成本也高。
规划 — 执行:先想再做
当任务足够长、足够复杂,边想边做就不够用了。规划 — 执行模式把“想”和“做”分成两个阶段:先自顶向下把目标分解成子任务,排好依赖关系(哪个先、哪个可以并行),画出一张任务地图;然后按图执行,每个执行单元专注自己的那一步。
它的设计哲学是关注点分离:规划者负责全局,执行者负责单点,互不干扰。好处是长任务有了全局掌控,可以并行优化;代价是计划可能过时——世界在变,画好的地图需要边走边改。所以成熟的规划 — 执行系统,执行中还要随时修订计划。
工具编排:调度能力
Agent 的能力上限,约等于它能调用的工具集。但工具越多,问题越难:接口五花八门,选错工具比没有工具更糟。
工具编排模式把工具组织成一条“能力总线”:每个工具都通过标准化接口接入,并附上语义化的描述——它是干什么的、接受什么参数、有什么副作用。Agent 不再需要硬编码每一个工具的用法,而是凭语义理解去选择:这个问题该查数据库,那个问题该调天气接口。标准化接口解决了“怎么调”,语义化描述解决了“选哪个”。于是,Agent 突破上下文窗口的限制,海量外部能力随取随用。
自适应策略:让策略进化
前三档都是“给定策略去执行”,但有些决策根本没有确定的最优解:是继续用已验证有效的老办法,还是冒险试试可能更好的新路?这就是经典的“探索与利用”难题。
自适应策略模式把决策本身交给学习:环境给出状态与奖励,学习器根据反馈不断调整策略网络——做对了,这条路被强化;做错了,下次避开。多臂老虎机、强化学习,都是这类机制。它的设计哲学是反脆弱的系统:系统不追求永不犯错,而是在反馈中变强,甚至把不确定性当作进化的养料——每一次失败,都是下一次更优策略的训练数据。
结语:决策的进阶之路
回头看这条进阶之路:简单任务,边想边做,灵活应变;长程任务,先想再做,全局掌控;能力扩展,靠工具编排,把外部世界变成自己的手脚;环境复杂,让策略自适应,在探索与利用中自我进化。
行动,是 Agent 与世界的对话。而怎么行动——从想一步做一步,到想清楚再动手,再到让“怎么想”本身也学会进化——才是智能最终的试金石。