Appearance
94. 什么是 AI Agent?它和传统的 LLM 有什么区别?
难度 P0 必背 · 岗位 应用 · 频率 ★★★ · 预计阅读 10 min
本题阅读地图
- 💡 简要回答
- 📝 详细解析
- 🎯 面试总结
👔面试官:什么是 AI Agent?和大模型有什么区别?
🙋♂️我:Agent 是能自主完成任务的人工智能系统,可以调用工具、做规划。LLM 只是生成文本,Agent 是完整的行动闭环。
👔面试官:Agent 的核心能力是什么?为什么说 LLM 是 Agent 的「大脑」?
🙋♂️我:核心能力是规划、记忆、工具使用。LLM 提供推理和决策能力,但 Agent 需要额外的模块来执行行动。
👔面试官:Agent 架构的必备组件有哪些?各有什么作用?
好,这道题要深入理解 Agent 的本质和架构。
TL;DR 速记
- 是什么:AI Agent 是能感知环境、做出决策并执行行动来达成目标的智能体。
- 关键点:传统 LLM 主要生成文本,Agent 在 LLM 之外补上规划、记忆、工具和执行闭环。
- 怎么答:先做 LLM vs Agent 对比,再讲 Planning、Memory、Tools、Execution 四个组件和 ReAct 循环。
图解
LLM 到 Agent 的能力扩展
💡 简要回答
AI Agent:能够感知环境、做出决策并执行行动以实现目标的智能体。
vs 传统 LLM:
| 特性 | 传统 LLM | AI Agent |
|---|---|---|
| 核心功能 | 文本生成 | 任务执行 |
| 交互方式 | 一问一答 | 多轮自主执行 |
| 工具使用 | 不能 | 能调用外部工具 |
| 记忆能力 | 上下文有限 | 长期记忆 |
| 规划能力 | 单步推理 | 多步规划 |
| 环境感知 | 无 | 能获取环境反馈 |
Agent 核心架构(ReAct 风格):
感知(Perception)→ 规划(Planning)→ 行动(Action)→ 记忆(Memory)
↑_________________________________________↓必备组件:
- 规划模块(Planning):分解任务、制定策略
- 记忆模块(Memory):存储上下文、经验、知识
- 工具模块(Tools):调用外部 API、函数
- 执行模块(Execution):将决策转化为行动
📝 详细解析
从 LLM 到 Agent 的演进
LLM 的局限:
问题 1:无法获取实时信息
用户:"今天北京天气怎么样?"
LLM:"作为 AI,我无法获取实时信息..."
问题 2:无法执行操作
用户:"帮我订一张明天去上海的机票"
LLM:"我无法执行预订操作..."
问题 3:无法长期维护状态
用户:"记住我的偏好"
LLM:下次对话会遗忘
问题 4:单步推理局限
复杂任务无法自动分解执行Agent 的解决:
解决方案 1:工具调用
- 调用天气 API 获取实时数据
- LLM 分析 API 返回结果
解决方案 2:行动执行
- 调用订票系统接口
- 完成实际预订操作
解决方案 3:记忆存储
- 将偏好写入数据库
- 后续对话检索使用
解决方案 4:规划执行
- 任务分解:订机票 → 查航班 → 选座位 → 支付
- 每步调用相应工具
- 根据反馈调整计划Agent 核心组件详解
1. 规划模块(Planning)
功能:
- 任务分解(Task Decomposition)
复杂任务 → 子任务序列
- 计划制定(Plan Formulation)
确定执行步骤和依赖关系
- 推理决策(Reasoning)
每一步选择最优行动
架构模式:
- ReAct:推理 + 行动交替
- Chain-of-Thought:逐步推理
- Tree-of-Thoughts:多路径探索
- Reflexion:自我反思改进2. 记忆模块(Memory)
短期记忆(Short-term Memory):
- 当前对话上下文
- 近期执行历史
- 实现:上下文窗口、Sliding Window
长期记忆(Long-term Memory):
- 用户画像和偏好
- 历史任务经验
- 领域知识库
- 实现:向量数据库、知识图谱、传统数据库
记忆操作:
- 存储(Write):将信息持久化
- 检索(Read):根据当前查询获取相关信息
- 更新(Update):修改已有记忆3. 工具模块(Tools)
工具类型:
- 信息获取:搜索、数据库查询、API 调用
- 计算能力:代码执行、计算器、公式求解
- 外部服务:邮件、日历、订票、购物
- 专业系统:CRM、ERP、内部工具
工具调用格式:
{
"thought": "需要获取天气信息",
"action": "get_weather",
"action_input": {"city": "北京"}
}
工具返回处理:
- 解析返回结果
- 决定下一步行动
- 或整合结果生成最终回答4. 执行模块(Execution)
功能:
- 将高层计划转化为具体行动
- 处理工具调用的实际执行
- 管理执行状态和错误处理
实现方式:
- 同步执行:一步一步按顺序执行
- 异步执行:并行执行独立子任务
- 人机协作:需要时请求人工确认Agent 的工作循环
典型 ReAct 循环:
1. 观察(Observation)
- 接收用户输入或环境反馈
2. 思考(Thought)
- LLM 分析当前状态
- 决定下一步行动
3. 行动(Action)
- 调用工具或生成回复
4. 观察结果(Observation)
- 获取工具返回或环境变化
5. 循环或终止
- 任务完成 → 输出最终结果
- 未完成 → 回到步骤 2Agent 的层级
Level 1 - 简单反射(Simple Reflex)
- 条件-行动映射
- 无状态、无规划
Level 2 - 基于模型的反射(Model-based)
- 维护内部世界模型
- 状态跟踪
Level 3 - 目标驱动(Goal-based)
- 有明确目标
- 选择能实现目标的行动
Level 4 - 效用驱动(Utility-based)
- 评估不同结果的效用
- 选择最优解
Level 5 - 学习型(Learning)
- 从经验中改进
- 自适应环境变化
当前 LLM-based Agent 主要在 Level 3-5常见踩坑与反例
- 踩坑 1:只说 Agent 能调工具。工具只是组件之一,还要讲规划、记忆、执行和反馈循环。
- 踩坑 2:把 LLM 和 Agent 对立起来。LLM 通常是 Agent 的大脑,Agent 是围绕 LLM 搭出的行动系统。
- 踩坑 3:只列概念,不讲工作循环。面试要能说清 Observation、Thought、Action、Observation 的闭环。
- 踩坑 4:忽略环境反馈。Agent 不是一次性生成答案,而是根据工具返回和环境变化调整下一步。
- 踩坑 5:不提工程边界。落地时还需要安全、权限、成本、超时和日志,而不只是模型能力。
面试官可能继续追问
- 追问 1:为什么说 LLM 是 Agent 的大脑? LLM 负责理解、推理和决策,但动作由工具和执行层完成。
- 追问 2:Planning 和 Execution 怎么分工? Planning 负责拆任务和选策略,Execution 负责按工具协议执行并处理失败。
- 追问 3:Memory 有什么作用? 短期记当前任务状态,长期记用户偏好、经验和外部知识。
- 追问 4:ReAct 的价值是什么? 把推理和行动交替起来,让模型能边观察、边行动、边修正。
🎯 面试总结
这道题容易踩的雷:
只说 Agent 能调用工具:不知道规划、记忆也是核心能力。
分不清层级:不知道 Agent 和 LLM 的关系是能力扩展。
不了解架构组件:说不出 Planning、Memory、Tools 的具体作用。
答题要点:
- 明确定义 Agent(感知-规划-行动闭环)
- 对比 LLM 和 Agent 的能力差异
- 详细说明四大核心组件
- 解释 ReAct 工作循环
- 提一句 Agent 的能力层级
来源参考:ReAct: Synergizing Reasoning and Acting in Language Models, LLM Powered Autonomous Agents, AutoGPT