Skip to content

94. 什么是 AI Agent?它和传统的 LLM 有什么区别? ​

难度 P0 必背 · 岗位 应用 · 频率 ★★★ · 预计阅读 10 min

本题阅读地图 ​

  1. 💡 简要回答
  2. 📝 详细解析
  3. 🎯 面试总结

👔面试官:什么是 AI Agent?和大模型有什么区别?

🙋‍♂️我:Agent 是能自主完成任务的人工智能系统,可以调用工具、做规划。LLM 只是生成文本,Agent 是完整的行动闭环。

👔面试官:Agent 的核心能力是什么?为什么说 LLM 是 Agent 的「大脑」?

🙋‍♂️我:核心能力是规划、记忆、工具使用。LLM 提供推理和决策能力,但 Agent 需要额外的模块来执行行动。

👔面试官:Agent 架构的必备组件有哪些?各有什么作用?

好,这道题要深入理解 Agent 的本质和架构。

TL;DR 速记 ​

  • 是什么:AI Agent 是能感知环境、做出决策并执行行动来达成目标的智能体。
  • 关键点:传统 LLM 主要生成文本,Agent 在 LLM 之外补上规划、记忆、工具和执行闭环。
  • 怎么答:先做 LLM vs Agent 对比,再讲 Planning、Memory、Tools、Execution 四个组件和 ReAct 循环。

图解 ​

LLM 到 Agent 的能力扩展 ​

💡 简要回答 ​

AI Agent:能够感知环境、做出决策并执行行动以实现目标的智能体。

vs 传统 LLM:

特性传统 LLMAI Agent
核心功能文本生成任务执行
交互方式一问一答多轮自主执行
工具使用不能能调用外部工具
记忆能力上下文有限长期记忆
规划能力单步推理多步规划
环境感知无能获取环境反馈

Agent 核心架构(ReAct 风格):

感知(Perception)→ 规划(Planning)→ 行动(Action)→ 记忆(Memory)
         ↑_________________________________________↓

必备组件:

  1. 规划模块(Planning):分解任务、制定策略
  2. 记忆模块(Memory):存储上下文、经验、知识
  3. 工具模块(Tools):调用外部 API、函数
  4. 执行模块(Execution):将决策转化为行动

📝 详细解析 ​

从 LLM 到 Agent 的演进 ​

LLM 的局限:

问题 1:无法获取实时信息
用户:"今天北京天气怎么样?"
LLM:"作为 AI,我无法获取实时信息..."

问题 2:无法执行操作
用户:"帮我订一张明天去上海的机票"
LLM:"我无法执行预订操作..."

问题 3:无法长期维护状态
用户:"记住我的偏好"
LLM:下次对话会遗忘

问题 4:单步推理局限
复杂任务无法自动分解执行

Agent 的解决:

解决方案 1:工具调用
- 调用天气 API 获取实时数据
- LLM 分析 API 返回结果

解决方案 2:行动执行
- 调用订票系统接口
- 完成实际预订操作

解决方案 3:记忆存储
- 将偏好写入数据库
- 后续对话检索使用

解决方案 4:规划执行
- 任务分解:订机票 → 查航班 → 选座位 → 支付
- 每步调用相应工具
- 根据反馈调整计划

Agent 核心组件详解 ​

1. 规划模块(Planning)

功能:
- 任务分解(Task Decomposition)
  复杂任务 → 子任务序列

- 计划制定(Plan Formulation)
  确定执行步骤和依赖关系

- 推理决策(Reasoning)
  每一步选择最优行动

架构模式:
- ReAct:推理 + 行动交替
- Chain-of-Thought:逐步推理
- Tree-of-Thoughts:多路径探索
- Reflexion:自我反思改进

2. 记忆模块(Memory)

短期记忆(Short-term Memory):
- 当前对话上下文
- 近期执行历史
- 实现:上下文窗口、Sliding Window

长期记忆(Long-term Memory):
- 用户画像和偏好
- 历史任务经验
- 领域知识库
- 实现:向量数据库、知识图谱、传统数据库

记忆操作:
- 存储(Write):将信息持久化
- 检索(Read):根据当前查询获取相关信息
- 更新(Update):修改已有记忆

3. 工具模块(Tools)

工具类型:
- 信息获取:搜索、数据库查询、API 调用
- 计算能力:代码执行、计算器、公式求解
- 外部服务:邮件、日历、订票、购物
- 专业系统:CRM、ERP、内部工具

工具调用格式:
{
    "thought": "需要获取天气信息",
    "action": "get_weather",
    "action_input": {"city": "北京"}
}

工具返回处理:
- 解析返回结果
- 决定下一步行动
- 或整合结果生成最终回答

4. 执行模块(Execution)

功能:
- 将高层计划转化为具体行动
- 处理工具调用的实际执行
- 管理执行状态和错误处理

实现方式:
- 同步执行:一步一步按顺序执行
- 异步执行:并行执行独立子任务
- 人机协作:需要时请求人工确认

Agent 的工作循环 ​

典型 ReAct 循环:

1. 观察(Observation)
   - 接收用户输入或环境反馈

2. 思考(Thought)
   - LLM 分析当前状态
   - 决定下一步行动

3. 行动(Action)
   - 调用工具或生成回复

4. 观察结果(Observation)
   - 获取工具返回或环境变化

5. 循环或终止
   - 任务完成 → 输出最终结果
   - 未完成 → 回到步骤 2

Agent 的层级 ​

Level 1 - 简单反射(Simple Reflex)
- 条件-行动映射
- 无状态、无规划

Level 2 - 基于模型的反射(Model-based)
- 维护内部世界模型
- 状态跟踪

Level 3 - 目标驱动(Goal-based)
- 有明确目标
- 选择能实现目标的行动

Level 4 - 效用驱动(Utility-based)
- 评估不同结果的效用
- 选择最优解

Level 5 - 学习型(Learning)
- 从经验中改进
- 自适应环境变化

当前 LLM-based Agent 主要在 Level 3-5

常见踩坑与反例 ​

  • 踩坑 1:只说 Agent 能调工具。工具只是组件之一,还要讲规划、记忆、执行和反馈循环。
  • 踩坑 2:把 LLM 和 Agent 对立起来。LLM 通常是 Agent 的大脑,Agent 是围绕 LLM 搭出的行动系统。
  • 踩坑 3:只列概念,不讲工作循环。面试要能说清 Observation、Thought、Action、Observation 的闭环。
  • 踩坑 4:忽略环境反馈。Agent 不是一次性生成答案,而是根据工具返回和环境变化调整下一步。
  • 踩坑 5:不提工程边界。落地时还需要安全、权限、成本、超时和日志,而不只是模型能力。

面试官可能继续追问 ​

  • 追问 1:为什么说 LLM 是 Agent 的大脑? LLM 负责理解、推理和决策,但动作由工具和执行层完成。
  • 追问 2:Planning 和 Execution 怎么分工? Planning 负责拆任务和选策略,Execution 负责按工具协议执行并处理失败。
  • 追问 3:Memory 有什么作用? 短期记当前任务状态,长期记用户偏好、经验和外部知识。
  • 追问 4:ReAct 的价值是什么? 把推理和行动交替起来,让模型能边观察、边行动、边修正。

🎯 面试总结 ​

这道题容易踩的雷:

  1. 只说 Agent 能调用工具:不知道规划、记忆也是核心能力。

  2. 分不清层级:不知道 Agent 和 LLM 的关系是能力扩展。

  3. 不了解架构组件:说不出 Planning、Memory、Tools 的具体作用。

答题要点:

  • 明确定义 Agent(感知-规划-行动闭环)
  • 对比 LLM 和 Agent 的能力差异
  • 详细说明四大核心组件
  • 解释 ReAct 工作循环
  • 提一句 Agent 的能力层级

来源参考:ReAct: Synergizing Reasoning and Acting in Language Models, LLM Powered Autonomous Agents, AutoGPT


章节首页 · ← Q93 · Q95 →

最后更新2026-05-01
难度P0
频率medium
阅读10 min
主题agent
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题