Skip to content

77. 什么是 DeepSearch?它和 RAG 有什么区别? ​

难度 P0 必背 · 岗位 应用 · 频率 ★★★ · 预计阅读 5 min

本题阅读地图 ​

  1. 💡 简要回答
  2. 📝 详细解析
  3. 🎯 面试总结

👔 面试官:DeepSearch 是什么?和 RAG 有什么区别?

🙋 我:DeepSearch 就是更深入的搜索?搜更多网页?

👔 面试官:搜更多网页只是量的变化,DeepSearch 的核心是质的变化——是一个迭代循环,不是一次性搜索。你了解吗?

TL;DR 速记 ​

  • 是什么:DeepSearch 是「搜索 - 阅读 - 推理 - 再搜索」的迭代研究循环,适合复杂、多源、多步整合问题。
  • 关键点:RAG 通常是单次检索后生成;DeepSearch 会边搜边判断缺口,自动生成下一轮搜索目标。
  • 怎么答:「DeepSearch 不是搜更多网页,而是让 Agent 像研究员一样反复提出问题、查证据、更新判断,直到证据足够或预算耗尽。」

图解 ​

图 1:DeepSearch 的迭代循环 ​

相关题

DeepSearch 可以看作开放研究场景下的动态检索;企业知识库内的动态检索可看 Q15 Agentic RAG,上下文组织可看 Q76 上下文工程。

💡 简要回答 ​

DeepSearch 是一种「迭代搜索-阅读-推理」循环,专门用于回答需要多步信息整合的复杂问题。它和 RAG 的本质区别在于:RAG 是单次检索 + 生成,DeepSearch 是多轮动态搜索 + 边搜边推理,更像一个在自主「做研究」的 Agent,而不是一个「查资料」的工具。

📝 详细解析 ​

先回顾 RAG 的工作方式 ​

标准 RAG 的流程是:接收问题 → 向量检索找相关文档 → 把文档塞进上下文 → LLM 生成答案。整个过程是一次性的:检索一次,生成一次,结束。

这对于「直接问答」类问题(「XX 是什么?」)表现很好。但遇到需要多步推理的复杂问题,单次检索往往信息不足,或者无法整合多个来源的信息得出结论。

DeepSearch 的核心:迭代循环 ​

DeepSearch 的工作方式是一个动态循环:

接收复杂问题
    ↓
分析:当前已知什么?还缺什么信息?
    ↓
搜索:生成本轮最关键的搜索词,去检索
    ↓
阅读:深度阅读搜索结果,提取有用信息
    ↓
推理:整合已知信息,判断问题是否能回答了?
    ├── 还不够 → 生成新的搜索词,继续循环
    └── 足够了 → 输出最终答案

关键机制:每轮搜索结束后,Agent 会评估「我现在拥有的信息,能回答原始问题了吗?」如果不够,它会自己分析「还缺什么」,生成新的搜索词,进入下一轮。这个过程完全自主,不需要用户介入。

RAG vs DeepSearch 对比 ​

维度RAGDeepSearch
检索轮次一次多轮迭代
适合问题类型直接问答、事实查询需要多步推理的复杂问题
推理深度浅(拿到资料就生成)深(边搜边推理,逐步逼近答案)
时间成本低高(多轮搜索 + 推理)
信息整合能力弱强(能整合多来源、多步骤的信息)
典型代表企业知识库问答Perplexity Deep Research、Google Deep Research

DeepSearch 适合解决什么问题 ​

DeepSearch 真正发力的是「专家级研究问题」:

  • 对比分析:「A 方案和 B 方案在工程可行性上有什么差异?」需要分别查询、对比、分析。
  • 因果推断:「为什么 2024 年底 AI 模型推理成本下降了那么多?」需要查多个因素、建立逻辑链。
  • 综合研判:「从技术、市场、监管三个维度评估 XX 行业的未来」——每个维度都需要单独调研再综合。

这类问题 RAG 单次检索根本搞不定,DeepSearch 的多轮迭代正是为此而生。

常见踩坑与反例 ​

踩坑 1:把 DeepSearch 理解成「搜更多」 ​

错误描述:「普通搜索查 5 个网页,DeepSearch 查 50 个网页」。

正确做法:核心不是数量,而是迭代:每轮阅读后判断缺口,再生成下一轮搜索问题。

踩坑 2:简单问题也上 DeepSearch ​

错误描述:「XX 是什么」这类直接问答也跑多轮搜索和推理。

正确做法:简单事实查询用普通搜索或 RAG;DeepSearch 留给多步对比、因果分析、综合研判这类高复杂度问题。

踩坑 3:没有证据充分标准 ​

错误描述:Agent 不知道什么时候该停止,一直搜索直到超时。

正确做法:定义停止条件:关键子问题已覆盖、来源足够多样、证据互相印证、达到轮次 / 成本上限。

踩坑 4:只给结论,不保留来源链 ​

错误描述:最终答案看起来像报告,但不知道每个判断来自哪些网页或文档。

正确做法:每轮提取证据时就记录来源、时间、可信度和原文片段,最终答案按结论绑定引用。

面试官可能继续追问 ​

  • 追问 1:DeepSearch 和 RAG 的本质区别是什么? 答题要点:RAG 多是单次检索 + 生成;DeepSearch 是多轮搜索、阅读、推理、再搜索,面向复杂研究任务。

  • 追问 2:DeepSearch 的停止条件怎么设计? 答题要点:证据覆盖关键子问题、来源交叉验证通过、连续搜索无新增信息,或达到最大轮次 / 时间 / token / 成本预算。

  • 追问 3:怎么避免搜索结果互相矛盾? 答题要点:记录来源权威性和时间,优先一手资料;冲突结论要显式标注,并继续补检验证。

  • 追问 4:DeepSearch 的成本为什么更高?怎么控? 答题要点:多轮搜索、多网页阅读、多次推理都会消耗时间和 token;通过轮次上限、查询去重、摘要缓存、分阶段模型控制成本。

🎯 面试总结 ​

答这道题抓住两个核心点:①DeepSearch 是「迭代循环」不是「一次搜索」,这是质的差别;②RAG 适合直接问答,DeepSearch 适合需要多步推理的复杂研究问题。最后可以举实际产品例子(Perplexity Deep Research、Google Deep Research)来佐证,让回答有现实落地感。


章节首页 · ← Q76 · Q78 →

最后更新2026-05-01
难度P0
频率medium
阅读5 min
主题rag
觉得有帮助?把这个链接转给正在求职的朋友 · 用 Ctrl + K 全站搜索其它题