Appearance
02 · AI Agent 智能体
本章题目导览
以下列表按题号自动排序;后续新增题目或中途插题会自动出现在正确位置。
Q1P012 min
什么是大模型 Agent?它与传统 AI 系统有什么不同?
**关键词** agent · intro · autonomy · tool-use · mcp · a2a
agentintroautonomytool-use
Q2P010 min
什么是工具调用(Tool Calling / Function Calling)?
**关键词** tool-calling · function-calling · json-schema · parallel-call
tool-callingfunction-callingjson-schemaparallel-call
Q3P011 min
Spring AI 工具调用与工具管理
**关键词** tool-use · framework
spring-aitool-useframework
Q4P09 min
Agent 在工具调用过程中如何处理错误和重试?
**关键词** error-handling · retry · robustness · agent-loop · fallback
error-handlingretryrobustnessagent-loop
Q5P08 min
什么是 MCP(Model Context Protocol)?
**关键词** mcp · protocol · tool-discovery · json-rpc · resources · prompts
mcpprotocoltool-discoveryjson-rpc
Q6P09 min
什么是 LangChain?LangChain 包含哪些核心概念?
**关键词** langchain · lcel · chain · memory · retriever · agents
langchainlcelchainmemory
Q7P120 min
LangChain 核心组件详解
用一笔退款咨询从零认识 LangChain 的消息、提示词、模型、检索器、工具、Runnable、Agent 与状态管理,并讲清这些组件怎样合作。
langchainpromptmodelretriever
Q8P022 min
什么是 LangGraph?它与 LangChain 有什么区别?
从零理解 LangGraph 的状态、节点、条件边、检查点与人工审批,再用退款审核案例说明它和 LangChain 如何配合。
langgraphlangchainstategraph
Q9P021 min
什么是 Prompt 工程?有哪些常用技巧?
从一条退款咨询出发,讲清 Prompt 的组成、常用技巧、结构化输出、注入风险与评测方法,让零基础读者能写出可验证的提示词。
prompt-engineeringfew-shotstructured-outputevaluation
Q10P020 min
什么是 CoT?请解释思维链提示的原理和适用场景?
用一道铅笔数量题理解思维链提示如何引出中间步骤、何时有用、为什么步骤仍须核对,以及它与 Self-Consistency 的区别。
chain-of-thoughtfew-shotzero-shotreasoning
Q11P018 min
什么是 Self-Consistency?它相比 CoT 解决了什么问题?
用同一道苹果计算题讲清思维链的单路径风险、自一致性的多路径采样与答案聚合,以及成本、适用条件和失败边界。
self-consistencychain-of-thoughtsamplinganswer-aggregation
Q12P022 min
什么是 Tree of Thoughts?它和 CoT 的区别是什么?
用 3、3、8、8 的 24 点问题,逐步讲清思路、状态、候选生成、评价、搜索和回退,并比较 CoT 与自一致性。
tree-of-thoughtschain-of-thoughtself-consistencysearch
Q13P117 min
LangSmith 是什么?如何用于 LLM 可观测性监控?
通过一次客服 Agent 退款咨询,解释 LangSmith 的 trace、run/span、模型与工具调用追踪、延迟与 token 看板、线上评测及敏感数据边界。
langsmithobservabilitytracingmonitoring
Q14P118 min
DeepSeek-R1 是什么?推理模型和普通模型有什么本质区别?
从一道分书题理解回答时的额外推导与验证,再讲清 DeepSeek-R1、R1-Zero 和蒸馏版的训练关系、成本与边界。
deepseek-r1reasoning-modelreinforcement-learningdistillation
Q15P118 min
没有强化学习经验,如何快速入手 AI 智能体开发?
从零区分强化学习与大模型应用开发,沿一条订单物流查询完成工具接入、执行循环、失败回退与评测。
agentreinforcement-learningtool-callingworkflow
Q16P024 min
如何用 Spring AI 实现联网搜索工具?
以查询 Spring AI 当前工具调用文档为例,从零实现带超时、来源链接和失败状态的搜索工具,并解释引用核对与提示词注入边界。
spring-aitool-callingweb-searchcitations
Q17P119 min
分层智能体架构是什么?怎么设计?
用一笔虚构退款咨询解释总控、证据协调与执行 Agent 的分层委派,讲清任务消息、状态汇总、权限、失败回退和适用边界。
multi-agenthierarchical-agentssupervisordelegation
Q18P120 min
Spring AI 中如何实现工具调用(Tool Calling)?
基于 Spring AI 2.0.1,用订单发货查询讲清工具注册、参数 Schema、ChatClient 调用循环、ToolContext 权限、异常处理与测试。
spring-aitool-callingchatclienttool-context
Q19P022 min
什么是 ReAct?如何基于 ReAct 模式构建具备自主规划能力的 AI 智能体?
用订单 A123 的退款咨询,追踪 ReAct 的 Thought、Action、Observation 如何交替,解释工具反馈改变计划的机制、实现循环与权限和终止边界。
reactagenttool-callingplanning
Q20P020 min
什么是 CoT 思维链?如何实现 CoT 思维链?
用书店算账例子,从零样本和带示例提示词写法,走到答案提取、程序核验、回归评测和推理模型的使用边界。
chain-of-thoughtprompt-engineeringfew-shotverification
Q21P120 min
在 AI 智能体项目中,你如何解决 Agent Loop 可能出现的死循环问题?
用客服查询耳机退货政策的正常与重复查询路径,解释 Agent Loop 的无进展检测、硬预算、工具错误、幂等、人工接管与监控。
agent-loopterminationtool-callingobservability
Q22P020 min
什么是 AI Agent?它和传统 AI 应用的区别是什么?
用同一笔物流异常咨询比较单次模型回答、固定工作流与运行时选工具的 Agent,说明自主边界、适用场景与失败处理。
agentworkflowtool-callingautonomy
Q23P118 min
Token 和上下文窗口是什么?它们在工程上意味着什么?
用订单客服的一次模型调用,解释 token 如何计数、上下文窗口如何容纳对话与工具结果,以及超限时的截断、成本和长对话治理。
tokencontext-windowtoken-budgetlong-context
Q24P120 min
大模型应用上线前你最关心哪些工程指标?
用客服 Agent 的一次退款咨询解释答案质量、尾部延迟、可靠性和每次成本,并给出可执行的验收口径与失败回退。
productionevaluationlatencyreliability
Q25P118 min
System Message 和 User Message 应该怎么分工?
用订单 A123 的退款咨询解释固定应用规则、用户任务与工具数据的不同权限,追踪正常答复、冲突请求和提示注入,并说明程序鉴权边界。
system-messageuser-messagedeveloper-messageinstruction-hierarchy
Q26P119 min
结构化输出有哪些常见做法?各自的优缺点是什么?
用客服退款判断的 JSON 结果,逐层讲清提示词约定、JSON 模式、Schema 约束、工具参数和应用校验的区别。
structured-outputjson-schematool-callingvalidation
Q27P023 min
如何做 Prompt 版本管理与回归?
以客服退款政策为例,说明怎样标识 Prompt 和运行配置、建立代表性测试集、比较基线,并在灰度发布后监控与回滚。
prompt-engineeringprompt-versioningevalsregression-testing
Q28P118 min
文本切块应该怎么设计?有哪些常见坑?
用一份耳机售后政策说明 RAG 文本切块怎样保住完整证据,如何选择大小与重叠、处理文档结构、保留元数据并评测检索。
ragchunkingretrievalmetadata
Q29P123 min
RAG 效果不好时,你会怎么排查?
沿一份新版退货政策的 RAG 问答链路,逐段检查源文档、解析、切块、召回、重排、上下文、生成与评测,定位错答最早出现的位置。
ragretrievalrerankingevaluation
Q30P120 min
混合检索、重排序和查询改写分别解决什么问题?
用耳机退货政策问答把查询改写、关键词与向量混合召回、候选重排放到同一条检索链上,解释各自作用、失效边界和评测方法。
raghybrid-searchrerankingquery-rewriting
Q31P120 min
RAG 应该如何接入 Agent 执行链路?
用一笔耳机售后咨询走完 Agent 选择检索、构造查询、权限过滤、接收证据、补查或停止、引用回答与链路评测。
ragagentretrievaltool-calling
Q32P025 min
为什么企业项目里的 RAG 必须重视权限、版本和引用?
用一笔耳机售后咨询,讲清企业 RAG 中谁能看、哪一版有效、回答依据在哪里,以及权限撤销、旧版混入与假引用怎样防。
ragaccess-controlversioningcitations
Q33P021 min
什么是 Lost in the Middle?它对 RAG 设计有什么启示?
依据 Lost in the Middle 原论文,用一份长退货资料说明关键证据在开头、中间、结尾的利用差异,以及 RAG 的排序、裁剪与位置评测。
lost-in-the-middlelong-contextragreranking
Q34P118 min
有了超长上下文模型,还需要 RAG 吗?
用同一笔耳机售后咨询比较整份资料进长上下文、先检索相关条款和两者组合,说明准确性、权限版本、成本与评测。
long-contextragretrievalgrounding
Q35P023 min
什么是 Agentic RAG?它和一次检索后直接生成有什么区别?
用一笔退款咨询贯穿检索、证据判断、再检索和停止条件,对比固定的一次检索生成链与 Agentic RAG 的运行时决策。
agentic-ragragretrievalevidence-evaluation
Q36P022 min
什么是 HNSW?它和暴力检索有什么区别?
用耳机退货政策向量检索,从全量距离计算到 HNSW 多层近邻图导航,解释构建、搜索、近似误差、参数和选型评测。
hnswvector-searchannnearest-neighbor
Q37P122 min
混合检索的稠密 + 稀疏融合策略有哪些?
用同一份耳机售后知识库,拆解稠密与稀疏检索的候选合并、RRF 排名融合、归一化分数加权,以及权限、版本、召回深度和评测边界。
raghybrid-searchbm25vector-search
Q38P115 min
工具描述(Tool Description)应该怎么写?
以客服查询订单与退货政策为例,解释工具名称、用途、参数、返回值和调用边界怎样写清,以及描述与服务端校验各自负责什么。
agenttool-callingfunction-callingtool-description
Q39P120 min
工具调用失败时,Agent 应该怎么处理?
用售后检测申请说明 Agent 如何区分超时、限流、权限和业务拒绝,核对写入结果,安全重试并在必要时停止或转人工。
agenttool-callingerror-handlingretry
Q40P119 min
多个工具如何选择?如何防止选错工具或循环调用?
以订单退款咨询为例,解释工具选择、参数与权限校验、重复调用检测、预算停止条件以及失败时的降级回答。
tool-callingtool-selectionpermissionsagent-loop
Q41P020 min
如何实现工具的并行调用?什么时候该串行?
以客服同时查询订单与积分、再按订单类别查询政策为例,解释工具调用的依赖图、异步并发、超时和部分失败汇合,以及写操作为何要谨慎串行。
agenttool-callingparallel-toolsconcurrency
Q42P118 min
Agent 与 Workflow 中工具调用的差异是什么?
用同一笔退款咨询逐步比较程序预定工具路径的 Workflow 与模型按结果选择下一步的 Agent,并说明权限、失败和适用边界。
agentworkflowtool-callingorchestration
Q43P124 min
工具调用的安全性与沙箱隔离怎么做?
以售后 Agent 的查单、查政策和退款请求为例,说明不可信内容怎样影响工具选择,以及服务端授权、最小权限和隔离执行各自要守住什么。
agenttool-callingsecuritysandbox
Q44P118 min
Function Calling 和 Tool Calling 有什么区别?
用查询订单 A123 的完整流程说明函数调用与工具调用的共同机制、各厂商命名、应用执行责任、内置工具及并行调用边界。
function-callingtool-callingjson-schemaagent
Q45P119 min
工具返回的结果太大时,Agent 怎么处理?
以退款政策工具一次返回大量记录为例,解释上下文预算、服务端筛选与分页、相关片段检索、可核验摘要和截断后的安全停止。
tool-callingcontext-windowpaginationretrieval
Q46P115 min
LangChain 的链式调用(Chain)和 LCEL 是什么关系?
用客服按已核实政策回答问题的固定流程,说明 Chain 是处理流程、LCEL 是 Runnable 组合写法,并区分当前 Runnable API 与旧版 LLMChain。
langchainchainlcelrunnable
Q47P122 min
LangGraph 解决了什么问题?和 LangChain 的区别是什么?
从一条会补查、等待人工、服务重启后继续的客服工单出发,讲清 LangChain 的现成 Agent 与 LangGraph 的显式状态流程如何分工。
langgraphlangchainagentstate
Q48P118 min
LCEL 的 | 管道符背后是什么原理?
以订单退款资格判断为例,拆解 Python 运算符重载、RunnableSequence 的逐步传值、RunnableParallel 的并发,以及批量、流式和异常的实际边界。
langchainlcelrunnablerunnable-sequence
Q49P120 min
LangGraph 的 State、Node、Edge 各自职责是什么?
用可运行的订单查询图说明 LangGraph 的状态字段、节点部分更新、固定与条件边、reducer,以及正常和缺资料时的完整执行轨迹。
langgraphstatenodeedge
Q50P118 min
LangGraph 中的持久化与 Checkpointer 是什么?
以客服说明草稿等待人工审核为例,解释 checkpoint、thread_id、短期状态与长期 store、中断恢复、节点重跑及外部写入的幂等边界。
langgraphpersistencecheckpointercheckpoint
Q51P024 min
如何在 LangGraph 中实现条件分支和循环?
用售后政策查询的两次取证示例,解释 StateGraph 的状态更新、条件边、回环、业务停止条件与 recursion_limit,并验证正常、资料缺失和图步骤超限三条路径。
langgraphconditional-edgesloopsstate
Q52P025 min
如何设计 LangChain 到 LangGraph 的迁移路径?
从现有客服 Agent 出发,解释何时需要定制 LangGraph、怎样盘点旧流程、设计状态和节点、验证等价性、灰度切流与回滚。
langchainlanggraphmigrationstategraph
Q53P118 min
你会如何设计一个 AI 应用的记忆系统?
以订单 A123 的客服对话为例,区分对话历史、短期状态、跨会话用户记忆与实时检索资料,并说明写入、读取、纠错及隐私边界。
memoryshort-term-memorylong-term-memorylanggraph
Q54P120 min
短期、中期、长期记忆各自适合什么场景?
用耳机售后工单解释 Agent 记忆的会话、未结任务和跨会话范围,说明写入、检索、更新、遗忘、权限与误记边界。
agentmemoryshort-term-memorylong-term-memory
Q55P120 min
超长多轮对话如何兼顾不断档和节省 Token?
用一段 30 轮耳机售后对话,说明上下文预算、近期原文裁剪、可核验事实卡与摘要、按需检索旧记忆,以及压缩失真后的评测与回退。
context-windowtoken-budgetconversation-memorysummarization
Q56P020 min
什么是 MCP?它解决的核心问题是什么?
用客服查询订单物流的例子解释 MCP 的 Host、Client、Server,工具发现与调用、Resources 和 Prompts、传输方式,以及标准接口与业务权限的边界。
mcptool-callingclient-servertools
Q57P120 min
MCP 和 Function Calling 的关系是什么?
用 Aurora 项目文档查询拆解模型提出函数调用与 MCP 客户端发现、执行外部工具的两段流程,并说明独立使用、平台托管和安全边界。
mcpfunction-callingtool-callingprotocol
Q58P118 min
MCP 技术协议的主体内容是什么?
以售后助手连接订单与政策服务为例,拆开 MCP 的 Host/Client/Server、传输、JSON-RPC 消息、版本与能力声明,以及 Resources、Prompts、Tools 和安全边界。
mcpprotocoltoolsresources
Q59P120 min
MCP 服务器开发流程是什么?
以订单物流查询为例,逐步说明 MCP Server 的能力设计、传输选择、SDK 实现、输入与权限校验、测试、发布和维护。
mcpservertoolsresources
Q60P122 min
Agent 应该如何接入 MCP 工具?
用 Aurora 文档查询讲清 Agent 接入 MCP 的连接、发现、筛选、调用和结果回传,附 LangChain 当前适配器示例、权限与故障测试。
agentmcptool-callinglangchain
Q61P118 min
A2A 和 MCP 的区别是什么?什么时候需要多智能体?
用耳机售后案例比较查订单工具与委托质检智能体:解释 A2A 任务协作和 MCP 工具资源接入的边界、单 Agent 与多 Agent 的选择、权限成本及失败处理。
a2amcpmulti-agenttool-use
Q62P120 min
MCP 的流式 HTTP 传输核心优势是什么?
以远程售后工具为例讲清 Streamable HTTP 的单端点 POST、JSON 或请求范围 SSE 响应、HTTP 基础设施复用、取消与 2026-07-28 版本边界。
mcpstreamable-httpssejson-rpc
Q63P119 min
MCP 调用如何保证并发?
以客服同时读取订单状态和配送说明为例,解释 2026-07-28 MCP 的独立请求、ID 对应、HTTP/stdio 传输、限流、竞态、取消与幂等边界。
mcpconcurrencyjson-rpcstreamable-http
Q64P118 min
Coze / Dify 这类平台和 LangChain / LangGraph 的关系怎么理解?
以耳机售后应用为例,分清可视化应用平台、LangChain 代码组件与 LangGraph 图运行时的层次、功能重叠、选型条件和迁移成本。
cozedifylangchainlanggraph
Q65P123 min
各类 Agent 开发框架应该如何选取?
从业务任务、控制权与运行约束出发,比较高层 Agent、图编排和多智能体框架,并给出可验证的选型 POC 与迁移成本清单。
agent-frameworkslangchainlanggraphopenai-agents-sdk
Q66P118 min
什么时候工作流比 Agent 更合适?
用一笔耳机售后检测申请,比较预设工作流与自主决策 Agent 的控制方式、正常与异常路径、成本和混用边界。
agentworkflowtool-callinghuman-in-the-loop
Q67P118 min
开源 RAG 平台比如 RAGFlow,应该如何选型?
用同一批企业制度文件和同一组问题做 POC,比较 RAGFlow、Dify 与自建方案的解析、检索、权限、运维和总成本。
ragragflowdifyplatform-selection
Q68P120 min
你会如何评估一个 RAG 或 Agent 系统的效果?
用同一组售后订单案例,分别评估检索证据、回答质量、Agent 工具轨迹、安全边界,以及上线后的时延与成本。
ragagentevaluationretrieval
Q69P122 min
多用户场景下,如何为 Agent 做安全沙箱隔离?
用两个企业租户共用 Agent 平台的例子,拆解身份、运行环境、文件、网络、凭据、数据授权、工具与资源配额各自负责的边界。
agentsandboxsecuritymulti-tenancy
Q70P028 min
如何确保 Agent 的行为安全、可控且符合人类意图?
用售后退款场景拆解目标边界、低信任内容、最小权限、工具执行关口、人工审批、幂等、观测与对抗测试。
agent-safetyprompt-injectionleast-privilegehuman-in-the-loop
Q71P118 min
Agent 链路耗时很长时,如何定位性能瓶颈?
用一次客服查询的 8.8 秒 trace,拆解排队、模型、检索、工具重试与最终生成,说明首 token、p95、关键路径和优化复测。
agentlatencyobservabilitytracing
Q72P118 min
意图识别 / 任务路由应该怎么做?
以耳机售后入口为例,讲清固定规则、分类器和大模型结构化意图,处理多意图与不确定输入,并把任务路由和权限校验分开。
intentroutingclassifierstructured-output
Q73P120 min
你会怎么做大模型应用的可观测性?
以客服 Agent 的退款到账咨询为例,串起 trace、span、模型与检索事件、日志、指标、隐私控制和一次线上故障定位。
agentobservabilitytracingmetrics
Q74P118 min
控制大模型应用成本,你会优先从哪些层面下手?
以耳机售后助手的单任务账单为例,按调用必要性、模型选择、上下文、缓存、RAG 与工具、批处理逐层降本,并守住质量与时延。
costtokensmodel-routingcaching
Q75P121 min
模型路由应该怎么做?
用客服任务说明何时不调用模型、如何按能力与任务难度选模型、失败后怎样回退,并用质量、时延和单任务成本验证路由。
model-routingmodel-selectioncostlatency
Q76P120 min
如果让你设计一个 NL2SQL Agent,你会重点控制哪些风险?
用华东订单按天汇总的例子,解释自然语言口径、数据库授权、参数化与 SQL 结构检查、资源预算、结果隐私和审计。
agentnl2sqlsqldatabase-security
Q77P120 min
如果让你设计一个客服智能体,你会优先考虑哪些能力?
用耳机售后咨询贯穿客服智能体的范围、知识和订单工具、身份权限、对话状态、人工接管、写操作、降级与上线评测。
agentcustomer-supportragtool-calling
Q78P022 min
如何设计 Agent 的完成判断与终止条件,避免过早结束?
以 B456 耳机退款申请为例,把用户目标拆成可核验的证据和工具状态,设计成功、待核实、失败、人工接管与上限终态。
agentcompletionterminationstate-machine
Q79P125 min
Code Agent 怎么设计?
从一个博客搜索故障出发,拆解代码智能体如何读仓库、限定修改范围、打补丁、运行验证、检查差异,并控制执行权限。
code-agentrepository-contextshellpatch
Q80P118 min
Deep Research 系统和普通 RAG 有什么不同?
用退货期试点决策,比较单轮 RAG 的证据检索与 Deep Research 的多步调查、交叉核对和带未知项的报告。
ragdeep-researchresearch-agentretrieval
Q81P028 min
如何设计一个 Deep Research 系统?
用客服知识库检索方案评估贯穿研究范围澄清、计划、搜索取原文、证据核验、定向补查、带引用报告和预算停止。
agentdeep-researchragweb-search
Q82P024 min
如何设计 Python 代码解释器?
用一份订单 CSV 走通模型写代码、隔离执行、收集标准输出与产物、验证结果和有限修正,并解释资源、文件、网络、依赖与审计边界。
pythoncode-interpretersandboxagent-tools
Q83P030 min
如何设计类 Manus 通用智能体?
用 20 人团建方案说明通用智能体怎样澄清目标、拆任务、在隔离工作区调用浏览器和代码、核验证据、交付文件并等待高风险动作确认。
general-purpose-agentplanningtool-usesandbox
Q84P022 min
如何开发浏览器自动化 Agent?
用售后单草稿任务讲清浏览器 Agent 的页面观察、元素定位、动作反馈、安全边界、等待恢复与 API 取舍。
agentbrowser-automationplaywrightcomputer-use
Q85P120 min
当 Agent 需要在真实或模拟环境中执行任务时,它和纯软件工具型 Agent 有什么本质区别?
用仓库机器人运送箱子对照软件派单,解释环境状态、局部观察、动作反馈、延迟、安全恢复、结果核验与仿真到现实的差距。
agentembodied-airoboticssimulation
Q86P118 min
Cursor、Claude Code、Copilot 这类 AI 编码工具的差异该怎么理解?
用同一个博客搜索 bug 按入口、执行环境、代码上下文、Agent 能力、评审与权限比较 Cursor、Claude Code 和 GitHub Copilot。
coding-agentcursorclaude-codegithub-copilot
Q87P022 min
什么是 AI Agent?与大模型有什么本质不同?
从查询并申请取消订单的例子,讲清大模型的输入输出、Agent 的工具与反馈循环、权限和停止条件,以及面试中容易混淆的边界。
ai-agentllmtoolsagent-loop
Q88P118 min
AI Agent 的主流设计模式有哪些?
以同一售后单说明提示链、路由、并行、编排执行、评估优化和动态工具循环,区分固定工作流与自主 Agent。
agentworkflowprompt-chainingrouting
Q89P118 min
反射模式(Reflection Pattern)
从客服答复的初稿、逐条核验、针对性反馈到修订,解释反射模式的机制、证据来源、成本和停止条件。
agentreflectionevaluationself-refine
Q90P116 min
工具使用模式(Tool Use Pattern)
以查询订单并起草答复为例,解释工具定义、模型提出调用、宿主校验执行、结果回传及权限和错误边界。
agenttool-usefunction-callingtool-result
Q91P115 min
ReAct 模式(Reason and Act)是什么?
用查询订单与物流的同一例子,解释 ReAct 中决策、动作和观察如何交替,以及失败、停止和规划的边界。
agentreacttool-callingreasoning
Q92P122 min
规划模式(Planning Pattern)怎样让 Agent 完成长任务?
以三家门店 CSV 生成周报为例,讲清目标拆解、步骤依赖、执行核验与动态重规划,以及计划不等于执行证据。
planning-patternplan-executetask-decompositionreplanning
Q93P118 min
多智能体模式(Multi-Agent Pattern)
用 X1 手表的游泳与保修问题,解释多 Agent 的任务拆分、协调合并、证据冲突、并行成本和失败处理。
agentmulti-agentorchestrationparallelism
Q94P118 min
AI Agent 和 AI Workflow 的区别在哪里?
围绕同一张售后单,比较代码预定步骤与模型根据反馈选步骤的控制权、异常处理、成本、安全和混合架构。
agentworkfloworchestrationcontrol-flow
Q95P116 min
上下文长度与规划缺陷如何影响长任务?
用跨会话分析 30 条工单的例子,解释上下文窗口、截断与压缩的风险,以及保存证据、重规划和评测的方法。
agentcontext-windowplanningcompaction
Q96P120 min
当前 AI Agent 有哪些主流的评价指标?
用同一组客服任务说明任务成功、工具轨迹、答案证据、安全、时延成本和用户体验的指标与分母。
agentevaluationmetricssafety
Q97P117 min
任务成功率(Task Completion Rate)
用 40 次固定客服任务算出独立完成率,讲清成功终态、分子分母、部分完成、人工接管、拒绝与分场景结果。
agentevaluationtask-success-rateoutcome
Q98P120 min
工具调用准确率(Tool Usage Accuracy)到底在测什么?
用客服查单任务算清工具选择与参数准确率,解释何时不该调用、如何评估多步轨迹,以及为什么工具调用正确不等于任务成功。
agent-evaluationtool-usage-accuracytool-selectionarguments
Q99P116 min
用户满意度(User Satisfaction)该怎样评估?
用同一组客服任务说明 CSAT 的采集与分母、响应偏差、任务成功和满意度的差别,以及安全底线与实验对比。
agentuser-satisfactioncsatevaluation
Q100P022 min
什么是 AI Agent 中的 Function Call?
以查询订单和可选提交售后申请为例,拆解函数定义、调用 ID、宿主执行、结果回传、并行依赖以及权限和副作用边界。
agentfunction-callingtool-callingjson-schema
Q101P122 min
AI Agent 中 Function Call 和 MCP 的区别是什么?
以查询订单 O-314 为例,拆解模型函数调用与 MCP 客户端/服务器分别解决什么问题、怎样组合,以及权限和工具执行由谁负责。
function-callingmcptool-integrationclient-server
Q102P115 min
AI Agent 中 A2A 和 MCP 的区别是什么?
用客服 Agent 委托财务 Agent 核对退款资格的例子,比较 A2A 的跨 Agent 任务与 MCP 的工具、资源接入。
agenta2amcpinteroperability
Q103P120 min
System Prompt 在 AI Agent 内部是如何工作的?
用客服建单流程解释高优先级指令如何进入模型调用、指导工具选择,以及为何后端权限和网关仍必须独立执行。
agentsystem-promptinstruction-hierarchyprompt-injection
Q104P022 min
什么是上下文工程(Context Engineering)?
以跨多轮售后客服任务为例,解释如何逐轮选择规则、用户请求、任务状态、工具结果和检索证据,并管理预算、压缩、持久化与注入风险。
agentcontext-engineeringcontext-windowcompaction
Q105P022 min
什么是 DeepSearch?它和 RAG 有什么区别?
用一张订单、一张运单和一条异常记录,解释多轮线索搜索与单轮检索增强生成的关系、成本和证据边界。
deepsearchragretrievalmulti-hop-search
Q106P124 min
AI Agent 如何实现长期记忆能力?
用跨会话语言偏好案例,拆解长期记忆的提取、确认、隔离、持久化、检索、更新与遗忘,并说明如何验证它真的记对了。
agentmemorylong-term-memorypersistence
Q107P119 min
AI Agent 的记忆机制有哪些作用和原理?
以跨会话相机售后为例,解释 Agent 记忆的连续性、个性化与经验复用,以及信息筛选、写入、取回、纠错和权限边界。
agentmemorycontextshort-term-memory
Q108P118 min
AI Agent 的记忆机制和 RAG 有什么区别?
以同一笔售后咨询比较记忆与 RAG 的目标、数据来源、写入读取、权限和时效,并展示两者与实时业务数据怎样组合。
agentmemoryragretrieval
Q109P118 min
AI Agent 的 Memory 子记忆类型有哪些?
用同一退款客服案例,区分短期与长期的保留范围,以及事实、经历、做法三种内容类型。
agentmemoryshort-term-memorylong-term-memory
Q110P120 min
AI Agent 记忆机制的核心组件和流程是什么?
以项目助手记住发布说明语言为例,拆解候选提取、写入校验、存储、检索过滤、上下文注入及反馈更新的完整数据流。
agentmemoryarchitectureretrieval
Q111P122 min
AI Agent 长期记忆的主流数据库有哪些?
从精确偏好与相似经历两种读取需求出发,比较 PostgreSQL/pgvector、Redis、MongoDB 和专用向量库,并给出选型与跨库一致性办法。
agentmemorydatabasevector-search
Q112P118 min
Memory 机制的核心设计目标是什么?解决了哪些痛点?
用跨会话查订单案例说明 Agent 记忆要解决的连续性、个性化、上下文成本与可靠性问题,并给出可衡量的隐私和错误边界。
agentmemorycontinuitypersonalization
Q113P022 min
如何实现跨 Agent 的记忆复用?
用客服到售后的退款交接,讲清共享范围、统一身份、命名空间与授权、带来源的记忆格式及并发冲突处理。
multi-agentmemoryshared-statelong-term-memory
Q114P118 min
AI Agent 上下文窗口溢出如何解决?
用发布流水线 B17 的长日志案例,解释上下文窗口和 token 预算,演示溢出前的计算、摘要与外部检索、溢出后的恢复和关键约束保护。
agentcontext-windowtoken-budgetcompaction
Q115P122 min
AI Agent 的 Skills 机制是什么?有什么作用?
以售后工单审核为例,解释 Skill 的目录与说明、任务匹配、按需加载、工具执行、权限边界和版本评测。
agentskillscontext-engineeringtool-use
Q116P121 min
AI Agent 开发有哪些主流框架?各自有什么特点?
以一笔售后申请为例,按语言生态、资料检索、工具循环、流程状态和协作方式比较 LangChain、LangGraph、LlamaIndex、CrewAI、Microsoft Agent Framework、AutoGen 与 Spring AI。
agentframeworkslangchainlanggraph
Q117P117 min
AI Agent 中 Agents、Teams、Workflows 的区别是什么?
以同一笔退款跟进为例,比较单个 Agent 的决策、多 Agent 协作与 Workflow 的流程控制,并说明 Agno API 与通用概念的边界。
agentmulti-agentteamworkflow
Q118P025 min
什么是 AgentOS?它的核心概念是什么?
以 Agno AgentOS 为例,说明 Agent、Team、Workflow 的定义怎样变成可调用、可保存会话、可管权限和可观测的运行服务。
agentagentosagnoruntime
Q119P118 min
AI Agent 如何实现子 Agent 的动态加载?
用发票差异核查说明父 Agent 如何按需发现、校验并运行受信任的子 Agent,控制输入与工具权限、接收带证据的结果并处理失败。
agentmulti-agentsubagentrouting
Q120P119 min
AI Agent 中的 AgentOS 概念及核心功能是什么?(进阶)
以一笔需人工审批的退款工单,解释 Agno AgentOS 在多实例、持久会话、后台任务、断线重连、权限与观测方面的生产边界。
agnoagentosproduction-runtimedurable-queue
Q121P117 min
描述一下 ReAct 模型在解决一个实际问题时的完整动态过程?
用虚构校园图书馆借书任务,逐轮追踪 ReAct 从馆藏搜索、东馆已借出转查西馆,到核对开放时间与路线后停止的动态过程,并解释错误、循环与可观察边界。
reactagentobservationtool-calling
Q122P020 min
什么是 Plan-and-Solve Prompting(PS)技术的核心思想及其要解决的主要问题?
用饮料分配题解释 PS 先拟计划再逐步执行的提示方式,区分 Zero-shot CoT 与 PS+,并说明漏步、算错和误解题意的边界。
promptingplan-and-solvezero-shot-cotreasoning
Q123P122 min
PS+ 在基础 PS 版本上做了哪些重要改进?这些改进如何具体提升性能?
对照 Plan-and-Solve 原论文,用图书数量题解释 PS+ 额外要求提取变量、核算中间量与常识,并说明它能减少哪些错误、不能修复哪些错误。
promptingplan-and-solveps-plusreasoning
Q124P118 min
从错误分析来看,PS 方法对语义理解错误的改善不明显,可能的原因是什么?有什么改进思路?
依据 Plan-and-Solve 原论文的 100 题错误分析,说明先计划仍可能沿着误读题意的方向求解,并用糖果转移题演示题意核对与可验证改进。
promptingplan-and-solvesemantic-understandingerror-analysis
Q125P118 min
在 LLM 的推理阶段,有哪些常见的解码策略?请解释 Greedy Search, Beam Search, Top-K Sampling 和 Nucleus Sampling (Top-P) 的原理和优缺点。
用“周末去”后五个候选的同一组概率,逐步计算贪心、束搜索、Top-K 与 Top-P 的选择过程,比较重复、多样性、成本和现代模型 API 的支持边界。
llminferencedecodinggreedy-search
Q126P117 min
L1 和 L2 正则化分别是什么,什么场景适合使用呢?
从过拟合出发,用同一组权重算清 L1 的稀疏和 L2 的收缩,说明特征缩放、相关特征、调参以及 AdamW 的区别。
machine-learningregularizationlassoridge
Q127P124 min
如何理解大模型的涌现能力?通常在多大规模出现?
从多位数加法的全对率与部分得分出发,解释涌现的原始定义、规模说法为何没有统一阈值,以及评测指标造成的争论。
llmemergent-abilitiesscalingevaluation
Q128P120 min
在训练一个百或千亿参数级别的 LLM 时,你会面临哪些主要的工程和算法挑战?(例如:显存、通信、训练不稳定性等)
以 100B 参数 BF16 模型为例算清训练状态显存,并系统解释分布式切分、通信、数据供给、数值稳定、容错与评估的相互制约。
llm-trainingdistributed-trainingmemoryparallelism
Q129P124 min
显存瓶颈:为什么单张 GPU 放不下大模型?
从 100B 参数的 BF16 权重算起,拆开权重、梯度、优化器状态、激活和临时缓冲,解释为什么加卡与分片也需要认真算显存。
llmtraininggpu-memoryfsdp
Q130P120 min
显存优化技术
以两张 24 GB GPU 训练 10 亿参数模型为例,算清激活重算、ZeRO/FSDP 分片、混合精度和 CPU/NVMe 卸载分别节省哪块显存、增加什么代价,以及如何验证峰值和训练正确性。
llm-traininggpu-memoryactivation-checkpointingzero
Q131P119 min
容错与长期训练
用两卡训练在第 460 步中断的例子,讲清检查点内容、数据与随机状态、分布式一致性、恢复演练和保存间隔取舍。
trainingfault-tolerancecheckpointdistributed-training
Q132P020 min
什么是 AI Agent?它和传统的 LLM 有什么区别?
用查找两人会议空档的任务,区分 LLM 模型本身与围绕目标、工具、状态、环境反馈和权限构成的 Agent 运行系统。
agentllmtool-callingplanning
Q133P028 min
什么是 Plan-and-Execute?它与 ReAct 有什么区别?
用一次出差报销核对任务,对照 ReAct 逐步决策和 Plan-and-Execute 显式规划、逐项执行与重规划,讲清各自成本与失败边界。
agentplanningreactplan-and-execute
Q134P118 min
LangChain 和 LlamaIndex 在 Agent 开发中的作用是什么?
用同一道客服退货政策问题走通 LangChain 与 LlamaIndex 两条路线,说明组件定位、重叠能力、组合方式和选型边界。
langchainllamaindexagentrag
Q135P119 min
Agent 如何与外部环境交互?环境接口设计有哪些要点?
以查询并预约会议室为例,解释 Agent 的观察、动作、工具接口、结果回传与状态更新,以及 schema、权限、并发冲突、幂等、超时重试和审计的设计边界。
agentenvironmenttool-callinginterface-design
Q136P030 min
如何评估大语言模型的性能?有哪些评估指标?
从客服问答出发,区分模型能力、任务正确率、事实依据、稳健性、安全性、延迟与成本,讲清离线评测到线上验证的完整做法。
llmevaluationmetricsbenchmark
Q137P020 min
什么是 MMLU?如何解读 MMLU 分数?
从四选一题目的预测与计分过程出发,解释 MMLU 的 57 学科、five-shot 协议、25% 随机基线、总体正确率的盲区及与 MMLU-Pro 的区别。
llmbenchmarkevaluationmmlu
Q138P020 min
如何设计一个模型评估的 A/B 测试?
以客服模型新旧版本为例,讲清实验假设、用户级分流、样本量、主指标与护栏、置信区间以及上线和回滚。
ab-testingmodel-evaluationonline-experimentmetrics
Q139P020 min
什么是 GSM8K?如何评估数学推理能力?
从一题果汁店应用题理解 GSM8K 的题目、答案格式、最终答案判分,以及步骤检查、污染与评测协议的边界。
gsm8kbenchmarkmath-reasoningevaluation
Q140P118 min
大模型的 Scaling Law 会持续有效吗?
从 Kaplan 与 Chinchilla 的训练损失经验规律出发,解释参数、数据、训练算力的关系,以及数据、推理算力、评测和架构变化带来的外推边界。
scaling-lawllm-trainingcomputedata-quality
Q141P027 min
如何看待 AI Agent 的未来发展?
结合工具使用、长任务评测与提示注入风险,解释 Agent 可能在哪些能力上进步,以及为什么可靠执行、权限和成本决定真实落地。
agentfutureevaluationtool-use
Q142P118 min
大模型的训练数据如何处理?
从来源授权到清洗去重、隐私过滤、评测隔离、分词与混合采样,用一份小数据集说明大模型训练数据的完整处理链。
llmtraining-datadata-curationtokenization
Q143P128 min
大模型的 Prompt 设计有哪些技巧?
从一个退货政策问答案例出发,讲清任务、资料、边界、示例、输出结构和失败处理怎样写进提示,并用评测而非感觉迭代。
llmprompt-engineeringfew-shotstructured-output