Appearance
77. 什么是 DeepSearch?它和 RAG 有什么区别?
难度 P0 必背 · 岗位 应用 · 频率 ★★★ · 预计阅读 5 min
本题阅读地图
- 💡 简要回答
- 📝 详细解析
- 🎯 面试总结
👔 面试官:DeepSearch 是什么?和 RAG 有什么区别?
🙋 我:DeepSearch 就是更深入的搜索?搜更多网页?
👔 面试官:搜更多网页只是量的变化,DeepSearch 的核心是质的变化——是一个迭代循环,不是一次性搜索。你了解吗?
TL;DR 速记
- 是什么:DeepSearch 是「搜索 - 阅读 - 推理 - 再搜索」的迭代研究循环,适合复杂、多源、多步整合问题。
- 关键点:RAG 通常是单次检索后生成;DeepSearch 会边搜边判断缺口,自动生成下一轮搜索目标。
- 怎么答:「DeepSearch 不是搜更多网页,而是让 Agent 像研究员一样反复提出问题、查证据、更新判断,直到证据足够或预算耗尽。」
图解
图 1:DeepSearch 的迭代循环
相关题
DeepSearch 可以看作开放研究场景下的动态检索;企业知识库内的动态检索可看 Q15 Agentic RAG,上下文组织可看 Q76 上下文工程。
💡 简要回答
DeepSearch 是一种「迭代搜索-阅读-推理」循环,专门用于回答需要多步信息整合的复杂问题。它和 RAG 的本质区别在于:RAG 是单次检索 + 生成,DeepSearch 是多轮动态搜索 + 边搜边推理,更像一个在自主「做研究」的 Agent,而不是一个「查资料」的工具。
📝 详细解析
先回顾 RAG 的工作方式
标准 RAG 的流程是:接收问题 → 向量检索找相关文档 → 把文档塞进上下文 → LLM 生成答案。整个过程是一次性的:检索一次,生成一次,结束。
这对于「直接问答」类问题(「XX 是什么?」)表现很好。但遇到需要多步推理的复杂问题,单次检索往往信息不足,或者无法整合多个来源的信息得出结论。
DeepSearch 的核心:迭代循环
DeepSearch 的工作方式是一个动态循环:
接收复杂问题
↓
分析:当前已知什么?还缺什么信息?
↓
搜索:生成本轮最关键的搜索词,去检索
↓
阅读:深度阅读搜索结果,提取有用信息
↓
推理:整合已知信息,判断问题是否能回答了?
├── 还不够 → 生成新的搜索词,继续循环
└── 足够了 → 输出最终答案关键机制:每轮搜索结束后,Agent 会评估「我现在拥有的信息,能回答原始问题了吗?」如果不够,它会自己分析「还缺什么」,生成新的搜索词,进入下一轮。这个过程完全自主,不需要用户介入。
RAG vs DeepSearch 对比
| 维度 | RAG | DeepSearch |
|---|---|---|
| 检索轮次 | 一次 | 多轮迭代 |
| 适合问题类型 | 直接问答、事实查询 | 需要多步推理的复杂问题 |
| 推理深度 | 浅(拿到资料就生成) | 深(边搜边推理,逐步逼近答案) |
| 时间成本 | 低 | 高(多轮搜索 + 推理) |
| 信息整合能力 | 弱 | 强(能整合多来源、多步骤的信息) |
| 典型代表 | 企业知识库问答 | Perplexity Deep Research、Google Deep Research |
DeepSearch 适合解决什么问题
DeepSearch 真正发力的是「专家级研究问题」:
- 对比分析:「A 方案和 B 方案在工程可行性上有什么差异?」需要分别查询、对比、分析。
- 因果推断:「为什么 2024 年底 AI 模型推理成本下降了那么多?」需要查多个因素、建立逻辑链。
- 综合研判:「从技术、市场、监管三个维度评估 XX 行业的未来」——每个维度都需要单独调研再综合。
这类问题 RAG 单次检索根本搞不定,DeepSearch 的多轮迭代正是为此而生。
常见踩坑与反例
踩坑 1:把 DeepSearch 理解成「搜更多」
错误描述:「普通搜索查 5 个网页,DeepSearch 查 50 个网页」。
正确做法:核心不是数量,而是迭代:每轮阅读后判断缺口,再生成下一轮搜索问题。
踩坑 2:简单问题也上 DeepSearch
错误描述:「XX 是什么」这类直接问答也跑多轮搜索和推理。
正确做法:简单事实查询用普通搜索或 RAG;DeepSearch 留给多步对比、因果分析、综合研判这类高复杂度问题。
踩坑 3:没有证据充分标准
错误描述:Agent 不知道什么时候该停止,一直搜索直到超时。
正确做法:定义停止条件:关键子问题已覆盖、来源足够多样、证据互相印证、达到轮次 / 成本上限。
踩坑 4:只给结论,不保留来源链
错误描述:最终答案看起来像报告,但不知道每个判断来自哪些网页或文档。
正确做法:每轮提取证据时就记录来源、时间、可信度和原文片段,最终答案按结论绑定引用。
面试官可能继续追问
追问 1:DeepSearch 和 RAG 的本质区别是什么? 答题要点:RAG 多是单次检索 + 生成;DeepSearch 是多轮搜索、阅读、推理、再搜索,面向复杂研究任务。
追问 2:DeepSearch 的停止条件怎么设计? 答题要点:证据覆盖关键子问题、来源交叉验证通过、连续搜索无新增信息,或达到最大轮次 / 时间 / token / 成本预算。
追问 3:怎么避免搜索结果互相矛盾? 答题要点:记录来源权威性和时间,优先一手资料;冲突结论要显式标注,并继续补检验证。
追问 4:DeepSearch 的成本为什么更高?怎么控? 答题要点:多轮搜索、多网页阅读、多次推理都会消耗时间和 token;通过轮次上限、查询去重、摘要缓存、分阶段模型控制成本。
🎯 面试总结
答这道题抓住两个核心点:①DeepSearch 是「迭代循环」不是「一次搜索」,这是质的差别;②RAG 适合直接问答,DeepSearch 适合需要多步推理的复杂研究问题。最后可以举实际产品例子(Perplexity Deep Research、Google Deep Research)来佐证,让回答有现实落地感。