English version: AI Learning Roadmap 08 · AI Agents
08 · 智能体开发
AI 学习路线图 · 第 8 站(共 9 站)
为什么这一站重要
到目前为止一切都是对话式的:你发一个请求,模型回答。智能体是更远的一步:一个追求目标的系统——规划步骤、调用工具、检查结果、记住状态、循环往复直到任务完成。不再是"给我写个摘要",智能体可以"研究这个主题、起草报告、存到我的网盘、完成后发邮件通知我"。
这正是这个领域前进的方向——每家主要实验室都把前沿产品定位在智能体方向上——也是当下应用 AI 里杠杆最高的技能。好消息:每个零件你都有了。第 7 站给了你函数调用、编排和评估。这一站把它们组装进循环,并教你区分"能跑的 demo"和"能用的智能体"的两件事:记忆和可靠性。
核心概念
1. 智能体范式
智能体就是循环里的一个大模型:
┌────────────────────────────────────────────┐
│ ▼
目标 ──► 推理:下一步该做什么? ──► 行动:调用工具 / 写内容
▲ │
│ ▼
└──── 观察:结果告诉了我什么? ◄──(结果返回)
和聊天机器人的区别:
- 有状态 —— 智能体跨很多步维护上下文(对话历史、中间结果、待办清单)。
- 多步 —— 一个请求触发很多次模型调用和工具调用,前后串联。
- 以目标为导向 —— 循环一直持续到目标达成或触发停止条件。
- 会犯错、能恢复 —— 一次失败的工具调用是观察结果,不是终点。
2. 规划 —— 智能体如何决策
- ReAct(推理 + 行动) —— 基础模式:交错进行思考("我需要当前价格,所以调用价格工具")、行动(工具调用)、观察(结果),并把每一步喂回去。推理和行动互相强化。几乎所有现代智能体都是包装更好的 ReAct。
- 任务分解 —— 把大目标拆成子任务(研究任务 → 大纲 → 搜索查询 → 逐节起草 → 组装)。显式计划(模型维护和更新的待办清单)胜过隐式计划。
- 反思(Reflection) —— 产出之后,智能体批判自己的输出并改进("这份报告完整吗?缺什么?")。便宜且出奇地有效——往往是最重要的单个质量杠杆。
- 先计划后执行 vs 边做边计划 —— 先写完整计划再执行(高效但脆弱:计划会漂移);或一次只计划一步(灵活,调用更多)。现代实践:先轻量计划,观察到达后随时重规划。
- **要知道的失败模式:**智能体会漂移——开局紧扣目标,慢慢走偏。缓解:让原始目标始终可见、设检查点、显式"我还在任务上吗?"的反思。
3. 工具 —— 智能体的手
工具就是第 7 站的函数调用,放到循环规模。设计规则在这里加倍重要:
- 窄而描述清晰的工具 —— 描述是模型决策的依据;含糊的工具 → 错误的选择。
- 把失败当数据 —— 返回错误的工具应该返回模型能据此行动的结构化消息("限流了,60 秒后重试"),而不是让循环崩溃。
- 权限边界 —— 破坏性工具(发送、删除、支付)需要确认或干跑模式。智能体可以提议;不可逆的事由人来批准。
- 工具泛滥是真实的 —— 每加一个工具都会降低选择准确率;5–10 个优秀工具胜过 50 个平庸的。
4. 记忆 —— 短期与长期
聊天机器人会忘;智能体必须记得。
- 短期记忆 —— 对话/上下文窗口。它是智能体的工作记忆,也是它的约束:有限,而且贵。上下文管理是核心工程技能:裁剪旧轮、总结已完成、把目标钉住、丢掉不再需要的。
- 长期记忆 —— 跨会话存活:向量存储保存过去的事实和文档(需要时检索相关记忆——这就是把 RAG 用到智能体自己的历史上),加上结构化存储(画像、待办状态、笔记)。
- 记忆管理模式 —— 总结(窗口满了就压缩历史)、检索(按需拉相关记忆)、结构化状态(关键事实放进模型可查询的 schema,而不是埋在散文里)。
5. 多智能体系统
多个专门智能体协作。模式:
- 主管/工人 —— 一个智能体规划和委派;工人执行子任务并汇报。最常见、最可控。
- 交接(Handoff) —— 把对话交给最合适的角色(分诊智能体 → 账单智能体)。客服常见。
- 辩论/互评 —— 两个智能体争论或互相审阅;提升推理任务质量,代价是 token。
- **多智能体何时有用:**任务确实有不同角色和技能,专精胜过单一通才时。**何时有害:**它倍增成本、延迟和失败模式——大多数"多智能体"demo 是一件风衣里裹着的一个调好的循环。从单一开始;有证据再拆。
6. 框架 —— 以及为什么至少手搓一次
选项一览:
- LangGraph —— 显式图/状态机语义;严肃智能体的行业默认;测试和检查点做得好。
- OpenAI Agents SDK / Claude Agent SDK —— 厂商原生、极简、上手快。
- AutoGen / CrewAI —— 面向多智能体。
- 你自己的循环 —— 100–200 行:模型调用 → 工具分发 → 状态更新 → 重复。
**建议:**先从零手搓一个最小智能体(一个周末),把心智模型变成自己的;再用 LangGraph(或 SDK)做真活。框架是管道;循环是思想,你必须把这个思想烂熟于心。
7. 可靠性与护栏 —— 工程核心
智能体的失败方式和聊天机器人不同——它们会行动,所以失败代价更高。护栏清单:
- 防循环 —— 最大迭代次数、超时、循环检测(同一个工具、同样的结果连续出现两次 = 停下重规划)。
- 错误隔离 —— 每个工具都包起来;循环能扛住单个失败。
- 成本控制 —— 每步和每次运行的 token 预算;失控的智能体就是燃烧的信用卡。急停开关。
- 人在环中 —— 不可逆操作前设检查点;信心不足时升级给人类。
- 安全 —— 工具权限是新的安全边界:最小权限、沙箱执行(在容器里跑代码)、输入校验(智能体是更大的提示注入面——你的智能体读到的一个恶意网页都可能试图操控它)、输出过滤。
- 关键路径要确定性 —— 智能体输出用 JSON schema 结构化,校验,校验失败时回退到确定性分支。
8. 评估智能体
评估比聊天机器人更难,因为存在轨迹,而不只是最终答案:
- 结果指标 —— 任务成功了吗?(任务套件上的成功率、最终产物的质量。)
- 轨迹指标 —— 效率(步数 vs 最优)、工具使用正确性(对的工具、对的参数)、循环纪律(没有无用的重复)。轨迹评估能抓住结果评估漏掉的问题。
- 实践:建任务套件(10–30 个代表性任务,带可检查的成功标准),每次改动都跑,同时追踪成功率和每次任务成本。这就是第 7 站黄金集的智能体版——凡是要上线的东西,都不可妥协。
工具与技能
- LangGraph(推荐框架)或你选的 SDK——外加一个手搓的最小循环。
- 工具层 —— 搜索、文件访问、沙箱代码运行器,也许一个浏览器工具。
- 向量存储(第 7 站的)用于长期记忆。
- 可观测性 + 评估 —— 每一步的追踪,以及一个脚本化任务套件。
动手任务
- **手搓最小智能体(第 1 周)。**一个 LLM、一个工具注册表(2–3 个工具)、一个带最大迭代护栏的循环。不用框架。让它完成一个两步任务(搜索 → 总结)。心智模型从此归你所有。
- **研究智能体(第 2–3 周)。**在 LangGraph 上,构建一个能研究主题的智能体:分解任务、搜索(或查 mock/搜索 API)、读来源、起草、反思、交付结构化报告。加长期记忆:一个记得过去研究、可复用的向量存储。
- **工作流智能体(第 3–4 周)。**构建第二个形状不同的智能体——比如邮件分诊或数据管线:读条目、分类、执行操作、升级。和研究的对比一下设计;注意什么能泛化。
- **护栏(第 4 周)。**故意尝试搞坏你的智能体:让它死循环(一个它完不成的任务)、给它一个没有确认的破坏性工具(它应该停下来)、通过检索内容注入指令(它应该忽略)。逐个修复。这是整份路线图里最有价值的调试。
- **评估套件(第 5 周)。**写 10–15 个带可检查结果的任务;跑智能体;测成功率和每次成本。做一处改进(更好的工具、反思、记忆)再测——数字应该会动。
里程碑检查点
满足以下条件,你才能进入第 9 站:
- 你的智能体端到端完成了一个真实的多步任务(不是 canned demo)。
- 你能凭记忆画出智能体循环,并说出每条箭头意味着什么。
- 你手搓过一次、用框架做过一次,能解释框架为什么存在。
- 你的智能体有:最大迭代护栏、错误隔离、token 预算、至少一个"人在环中"检查点。
- 你有任务套件,测得成功率和每次任务成本——并且至少各改进过一次。
精选资源
- Anthropic —— "Building effective agents"—— 重读;关于智能体架构和"何时智能体才是正确答案"最清晰的文章。
- LangGraph 教程—— 从模式到代码的最快路径,含记忆和多智能体。
- ReAct 论文(Yao 等,2022)—— 基础模式;短且好读。
- 《基于大语言模型的智能体的崛起与潜力》(综述)—— 智能体架构、记忆分类法和开放问题的权威地图。
- OpenAI / Claude 智能体文档—— 生产环境中的厂商原生模式与工具 schema。
时间规划
- **总计:**约 6 周,每周 10–15 小时(约 75 小时)。
- **建议安排:**第 1 周 → 手搓循环(任务 1);第 2–3 周 → 研究智能体 + 记忆(任务 2);第 4 周 → 工作流智能体 + 护栏(任务 3–4);第 5–6 周 → 评估套件、迭代、里程碑。
衔接下一站
你到达了地图的顶端:从零到一个能工作的智能体。第 9 站是最后一篇文章,它做的事情不一样——它向外、向前看:多模态模型、生产运维、塑造未来五年的前沿研究,以及如何把学到的这一切变成作品集和职业。这条路快要完全属于你了。
No comments yet.