Skip to content

59. 什么是 AI Agent?与大模型有什么本质不同? ​

难度 P0 必背 · 岗位 应用 · 频率 ★★★ · 预计阅读 7 min

本题阅读地图 ​

  1. 💡 简要回答
  2. 📝 详细解析
  3. 🎯 面试总结

👔 面试官:说说你理解的 AI Agent 是什么?

🙋 我:就是能调用工具的大模型,给它配几个 API,让它能联网搜索、查数据库之类的。

👔 面试官:工具调用不等于 Agent。一个能 Google 的 ChatGPT 就是 Agent 了?Agent 最核心的词是什么?

🙋 我:呃……自主性?它自己决定调哪个工具?

👔 面试官:还不够。自主决定只是一半。另一半呢?执行完一步之后呢?

被问懵了吧。其实答好这道题,抓住两个词就行:自主闭环。

TL;DR 速记 ​

  • 是什么:AI Agent 是能围绕目标自主规划、调用工具、感知结果并持续调整的系统。
  • 关键点:与普通 LLM 的本质区别,是它有「感知 → 规划 → 行动 → 再感知」的执行闭环。
  • 怎么答:别停在“会调工具”,要讲自主性、行动力、记忆/状态和闭环纠错。

图解 ​

普通 LLM vs Agent ​

💡 简要回答 ​

AI Agent 本质上是一个能自主完成复杂目标的 AI 系统。跟普通大模型最核心的区别,是它有一个运转的感知 → 规划 → 行动 → 再感知的闭环。

你给它一个目标,它会自己把任务拆解成多步,调用工具、查询记忆、感知执行结果,然后根据结果调整下一步,直到完成——而不是一问一答就结束。它不只是输出文字,而是真的能做事。

📝 详细解析 ​

普通大模型的三道墙 ​

要理解 Agent,得先搞清楚普通大模型的局限在哪。它被三道墙困住了:

第一道:知识被冻结。 训练数据有截止日期,你问它今天的新闻、最新的股价,它完全不知道。知识就像一个人高中毕业后再没看过新闻,永远停在那个时间点。

第二道:手脚被绑住。 你让它帮你发邮件、执行代码、操作数据库,它只能告诉你"你可以这样做……",但自己做不到。它本质上是个文本生成器,所有输出都是一串文字,点"发送"的手它没有。

第三道:记忆是断的。 每次调用之间完全失忆。除非你手动把上下文传进去,否则它不记得刚才说了什么,更别说跨任务记住你的偏好了。

三道墙叠在一起,导致普通 LLM 只能做「一问一答」,稍复杂一点的多步任务完全无能为力。

Agent 凭什么不一样? ​

Agent 有一个核心闭环:感知 → 规划 → 行动 → 再感知。

你给它「帮我调研竞品然后整理成报告」,它不是直接输出一段文字了事,而是:先拆解任务(搜哪些关键词、访问哪些网站、怎么组织内容),然后一步步执行,每步结果反馈回来,再指导下一步。

这个闭环背后有三件核心事在撑着:

第一件:工具调用(Tool Use)——让 Agent 从「说话」变成「做事」的关键。Agent 能调用搜索引擎、代码执行器、数据库、API 等外部工具。有个容易混淆的点:不是模型自己执行,而是模型告诉你该调什么,你的代码去真正执行,结果再反馈给模型。模型始终只是大脑,不是手脚。一下子突破了前面三道墙:知识冻结?接搜索引擎。手脚被绑?接 API。

第二件:记忆机制——Agent 通常有短期和长期两层记忆。短期记忆是当前任务执行的中间状态,存在上下文里;长期记忆是跨任务的用户偏好、历史记录,通常存进向量数据库,需要时语义检索拿回来。有了这两层,Agent 执行复杂任务才不会「走到一半忘了目标是什么」。

第三件:多步推理与自我纠错——这是 Agent 跟简单自动化脚本最本质的区别。执行中某一步失败了,Agent 不会直接崩掉,它能感知失败、分析原因、换策略重试。搜索关键词 A 没找到有用信息,自己换关键词 B 再搜。API 报错了,看报错信息调整参数重调。这种「边做边反思」的能力,让 Agent 面对复杂不确定任务时,表现远比死板的自动化流程好得多。

为什么 Agent 现在才爆发? ​

Agent 的概念很早就有,为什么 2024、2025 年才真正火起来?三个条件同时成熟了:

  • 大模型能力跨过「能用」门槛:从 GPT-4、Claude 3 这代开始,推理能力和指令遵循能力有了质的飞跃,模型真的能读懂复杂指令并做出合理的多步决策了。
  • 工具调用标准化:OpenAI 2023 年推出 Function Calling,模型能以结构化 JSON 格式输出工具调用请求,各家模型厂商跟进,有了统一协议开发者才能方便地给模型接上各种外部能力。
  • 配套生态完善:LangChain、LlamaIndex 大幅降低开发门槛,向量数据库解决长期记忆问题,MCP、A2A 等标准协议的出现进一步规范了生态。

三个条件凑齐,Agent 才从论文概念变成了工程实践。

常见踩坑与反例 ​

  • 踩坑 1:把 Agent 等同于工具调用。工具调用只是行动能力的一部分,Agent 的关键是自主规划和闭环执行。
  • 踩坑 2:只讲“自己决定调哪个 API”。这只覆盖决策点,还要讲执行结果如何反馈并影响下一步。
  • 踩坑 3:忽略模型和工具的边界。模型负责推理和决策,真正执行由外部代码、工具或系统完成。
  • 踩坑 4:不提记忆和状态。复杂任务需要短期状态、历史轨迹和长期偏好,否则很容易中途丢目标。

面试官可能继续追问 ​

  • 追问 1:Agent 和普通自动化脚本有什么区别? 脚本是固定流程,Agent 能根据反馈动态规划、换策略和纠错。
  • 追问 2:最小 Agent 架构包含什么? LLM 大脑、工具集合、运行循环、状态/记忆和安全边界。
  • 追问 3:Agent 为什么现在才火? 模型推理能力、结构化工具调用和生态框架同时成熟。
  • 追问 4:生产落地最大风险是什么? 长链路不稳定、权限失控、成本不可控和结果不可复核。

🎯 面试总结 ​

这道题踩雷的方式通常有三种:

  • 把 Agent 等同于「插件」或「工具调用」——工具调用只是 Agent 能力的一部分,不是 Agent 本身。
  • 停在「能调工具」这一层——没有点出自主性,Agent 的关键不是「有工具」,而是「自己决定用不用、什么时候用、用哪个」。
  • 忽略执行闭环——感知 → 规划 → 行动 → 再感知这个循环才是 Agent 区别于普通 LLM 的核心机制。

答题时抓住三件事:① Agent 有自主规划能力,给它复杂目标它能自己拆解成多步;② 它能行动,通过工具调用跟外部世界真实交互;③ 它有闭环,每步结果反馈回来指导下一步。最后别忘了补一句容易混的点:模型只负责大脑(决策),工具的真正执行是你的代码。


章节首页 · ← Q58 · Q60 →

最后更新2026-05-01
难度P0
频率medium
阅读7 min
主题agent
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题