🎯 课程主题
讲解 Agent(智能体)的核心架构与五大组成要素,建立对智能体全面认知。
📝 核心知识点
1. Agent 的定义与核心公式
- 概念说明:Agent(智能体)是利用大模型的推理决策能力,逐步完成给定目标的自治系统。部分文档翻译为"代理",但"智能体"更准确。
- 核心公式:Agent = LLM(大脑) + Planning(规划) + Tools(工具) + Memory(记忆) + Action(行动)
- 来源:2023 年 6 月 OpenAI 华人元老翁丽莲(Lilian Weng,北大校友)提出的现代 Agent 架构,已被业界广泛接受。
2. 五大要素详解
2.1 LLM — 智能体的大脑
- 概念说明:大语言模型是 Agent 的决策核心,负责推理、规划和内容生成。
- 关键细节:
- 不一定每次都用最强模型:Agent 执行过程中可能多次调用 LLM,最强模型成本高、响应慢。
- 简单任务可用小模型(更便宜、更快),复杂任务再调用大模型。
- 参考案例:OpenAI Operator 一晚花费巨大,全用最强模型不可持续。
2.2 Planning — 规划决策
- 概念说明:将复杂任务拆解为可执行的子步骤,制定行动路径。
- 关键细节:如"创建一个电商网站"不能上来就写代码,应先做架构规划。这与 Deep Research 概念密切相关。
2.3 Tools — 工具调用
- 概念说明:Agent 通过调用外部工具(API、数据库、第三方服务等)获取 LLM 自身不具备的能力。
- 生活类比:大脑分析出汉诺塔的移动策略,但真正移动需要手和眼睛充当"工具"。
- 典型工具:天气 API(墨迹天气)、出行 API(滴滴)、酒店预订(携程/美团)等。
2.4 Memory — 记忆能力
- 短期记忆:
- 作用于当前会话窗口内,模型能记住本轮对话的上下文。
- 受限于模型的上下文窗口大小,当前主流模型已支持百万级 Token。
- 长期记忆:
- 跨会话 / 跨时间周期,记住用户偏好、历史指令等。
- 实现方式可能涉及知识图谱、向量数据库等。
- 后续有专门章节讲解。
2.5 Action — 行动执行
- 概念说明:将规划决策转化为具体的代码执行和功能调用,不能"纸上谈兵"。
🏗️ 架构与工作流
┌─────────┐ ┌──────────┐
│ Memory │────→│ LLM │←──── Planning
│ (记忆) │ │ (大脑) │
└─────────┘ └────┬─────┘
│
┌───────┴───────┐
↓ ↓
┌─────────┐ ┌──────────┐
│ Tools │ │ Action │
│ (工具) │ │ (行动) │
└─────────┘ └──────────┘
以"打车去西藏旅游"为例:
- Planning:规划路线(从哪里出发、经过哪里、住哪里)
- Tools:用滴滴打车、用携程订酒店
- Memory:记住要订西藏路上的酒店,不能订到新疆去
- Action:说走就走,实际执行
💻 代码实战
本节课以理论讲解为主,代码实战将在后续"记忆"和"工具调用"专题中展开。
⚠️ 常见问题与避坑指南
- 不要盲目追最强模型:综合考虑成本、延迟和任务难度进行模型选型。
- Agent 开发需四要素协同,缺一不可:缺记忆则前后文断档,缺工具则能力受限,缺规划则应对复杂任务无力。
💡 个人总结与延伸
翁丽莲提出的 Agent 五大要素框架已成为行业共识,LangChain/LangGraph 的 API 设计也围绕这五大要素展开。理解这套框架后再学 LangChain 的 Tool、Memory、Chain 模块会豁然开朗。当前业界趋势是 Agent 从"单智能体"向"多智能体协作"演进(如 CrewAI、AutoGen),DeepAgents 正是 LangChain 生态在这方面的布局。