Appearance
Q14 · DeepSeek-R1 是什么?推理模型和普通模型有什么本质区别?
一道题说:“甲乙一共有 32 本书。甲给乙 5 本后,两人一样多。原来各有多少本?”模型可能直接答“甲 21 本、乙 11 本”。这个答案是对的,但要放心地采用它,还可以多做一步:原来合计 21+11=32,转移后两人各有 16 本。遇到更复杂的题,先列关系、推导、再代回检查,会比直接给一个看似合理的数字更有机会发现错误。
DeepSeek-R1 是 DeepSeek 在 2025 年发布的一组推理模型中的正式版本。 它在训练中强化了为复杂问题生成较长中间推导、反思和验证的能力。这里的“推理模型”指这类经过专门训练、在回答时愿意投入更多计算处理难题的模型;它并不意味着普通聊天模型不会推理,也不保证写得越长就越正确。DeepSeek-R1 官方论文记录了训练路径和局限。
先认清术语与名字
| 词或名字 | 直白解释 | 分书题或 R1 中的对应物 |
|---|---|---|
| 大语言模型(LLM) | 依据输入逐步生成文本的模型 | 读题并生成答案的程序核心 |
| 普通聊天模型 | 这里指以通用对话、写作和指令执行为主,调用时通常先追求直接回答的模型或模式 | 看到题后可能很快给出 21、11;也可以在提示下列式 |
| 推理模型 | 对较难的多步问题有专门训练或推理模式,回答时可能产生更多中间计算 | 先列 甲+乙=32,再检验转移后的数量 |
| 预训练 / 基座模型 | 用大规模数据先学会语言、知识和基本能力的训练阶段及其产物 | R1-Zero 和 R1 从 DeepSeek-V3-Base 出发 |
| 后训练 | 基座模型之后,为特定目标继续训练 | 让模型更善于解题、遵循要求与表达 |
| SFT(监督微调) | 用“输入与期望输出”的示例继续训练 | 给模型可读的解题样例和通用回答样例 |
| RL(强化学习) | 模型生成答案后,根据奖励信号调整后续生成倾向 | 对可核验的数学、代码答案给予反馈 |
| GRPO | R1 论文所用的一种强化学习算法,利用一组候选回答之间的相对表现来更新模型 | 同一道题采样多种回答,比较所得奖励 |
| 冷启动数据 | 正式的大规模 RL 之前,少量质量较高的示例数据 | 为 R1 提供较可读的推导起点 |
| 蒸馏 | 用强模型产生的样例,训练较小的“学生模型” | R1 产出训练数据,再微调 Qwen/Llama 基座模型 |
| 推理时计算 | 已训练模型处理一次新请求所用的计算;“推理”在这里也指运行模型 | 生成推导、检查步骤所占的输出 token 与时间 |
| token | 模型处理文本的计量单位,可能是字、词或词片段 | 较长的中间推导通常用更多输出 token |
注意“推理模型”里的推理与“推理时计算”里的推理有两层意思:前者是解决问题的能力,后者是已经训练好的模型实际运行一次。下文会分别说训练时怎样塑造能力、调用时怎样花计算。R1、R1-Zero 和 R1-Distill-* 也不是同一个权重文件的三个名字。
同一道题,回答时多花的计算在哪里
先沿分书题看一条可检查的路径。设甲原来有 甲 本、乙原来有 乙 本,这两个字代表未知数量,不是模型内部的特殊变量。题目给了两条条件:
text
甲+乙=32
甲-5=乙+5第二条说明,甲给出 5 本后减少 5,乙收到后增加 5;整理得 甲-乙=10。与总数 32 合起来,可算出甲原来 21 本、乙原来 11 本。再代回原题:21+11=32,且 21-5=11+5=16。如果答案写成“甲 20、乙 12”,总数虽对,转移后是 15 与 17,检验就会抓到错误。

图展示的是两种调用时的典型处理路径,并非两类模型永远固定的行为。普通聊天模型可以被要求列式、检验;推理模型也可能在简单题上简短回答。更稳定的区别是训练目标与调用时愿意分配的计算:专门的推理训练会鼓励模型在难题上产生有用的中间步骤,而较长的步骤意味着更多生成、更多时间和通常更高的资源消耗。中间文字即使看起来有条理,也可能藏着错误,所以最终答案仍须按题目规则检查。
“多想一会儿”也不等于自动运行了树搜索。像 ToT 思维树 那样显式保留多个候选、逐个评价并回退,需要相应的搜索流程;看到一段模型自我修正的文字,不能据此断定它在后台执行了 ToT。
R1-Zero、R1 与蒸馏版分别怎么来
三者都与推理能力有关,但训练路线不同。官方仓库的模型说明和论文的 R1 训练章节给出了关键区别:
| 名字 | 起点与主要训练 | 为什么要这样做 | 需要记住的边界 |
|---|---|---|---|
| DeepSeek-R1-Zero | 从已预训练的 DeepSeek-V3-Base 出发,不先做监督微调,直接进行大规模 RL | 检验仅用 RL 能否激励长推导、反思、验证等行为 | “Zero”不是从零训练;可读性差、重复和中英混用是论文报告的问题 |
| DeepSeek-R1 | 同样基于 DeepSeek-V3-Base;先以少量冷启动数据做 SFT,再做推理 RL;之后用筛选的数据再做 SFT,最后做兼顾通用偏好等目标的 RL | 保留解题能力,同时改善可读性、指令遵循与通用回答 | 这是多阶段后训练,不应说成“只用了 RL” |
| DeepSeek-R1-Distill 系列 | 用 R1 生成的样例微调较小的 Qwen 或 Llama 基座模型;原论文的蒸馏阶段使用 SFT | 把强模型的解题样式和能力迁移到更小的权重 | 学生模型不是把完整 R1 压缩成同一架构,也不能等同于 R1 本体 |
R1-Zero 的“只用 RL”特指基座模型之后的这段推理后训练没有先用 SFT。它仍依赖此前的大规模预训练。论文描述的可核验任务会对最终答案给奖励:例如数学答案能否与标准结果一致、代码能否通过测试。GRPO 对同一道题采样一组回答,根据相对奖励更新模型,让更有用的生成方式变得更常见。这个解释只说明训练信号的方向,不意味着每一行中间推导都被人工逐句标注或保证正确。论文的 R1-Zero 与奖励设计
R1 为什么不沿用 R1-Zero 的纯 RL 路线?因为“能解出题”和“让人清楚读懂、按要求回答”不是同一件事。官方论文报告 R1-Zero 出现可读性和语言混用问题;R1 用冷启动示例与后续通用数据来处理这些问题,同时继续用 RL 增强推理和偏好对齐。原论文将 R1 的后训练概括为两轮 SFT、两轮 RL;这不是四次独立的从头预训练。蒸馏版则用 R1 生成的样例微调更小的模型,官方仓库列出了 1.5B、7B、8B、14B、32B、70B 等版本。参数较少通常更容易部署,但能力、延迟与资源需求仍要按具体版本实测。官方仓库
“普通模型”和“推理模型”到底差在哪
下表比较的是倾向与设计重点,不是互斥的物种。今天的模型也可能在同一权重上切换思考与非思考模式;DeepSeek 当前思考模式文档就提供了开关与推理强度控制。
| 比较维度 | 通用聊天模式的常见目标 | 推理模式的常见目标 |
|---|---|---|
| 后训练重点 | 指令跟随、对话质量、写作与广泛任务表现 | 另对多步解题、可验证正确性和自检投入训练 |
| 一次回答的过程 | 可以直接给结论,也可以应要求列步骤 | 更倾向于先处理复杂条件、生成中间推导再给结论 |
| 计算与延迟 | 简单任务可用较短输出完成 | 难题可能消耗更多输出 token 和等待时间 |
| 适合的任务 | 摘要、改写、普通问答及简单计算等 | 多约束数学、复杂代码和需要反复核对的推导等 |
| 常见风险 | 直接猜答案、漏看约束 | 过度思考、冗长且仍可能答错,推导文字也不等于证据 |
本质区别主要在训练和计算预算如何分配,不是“有无推理能力”的开关。给普通模型好的示例、工具和检验器,它也能解决多步问题;一个推理模型如果缺少事实、误读条件或被错误的中间步骤带偏,同样会失败。R1 论文还报告简单问题上的过度思考、部分语言混用,以及当时版本的结构化输出、工具使用等局限;这些是论文所研究版本的结论,不应直接当成所有后续 DeepSeek 模型的现状。论文局限章节
今天调用 DeepSeek 时怎样理解“R1”
模型名、API 别名和“思考模式”要分开。 2025 年 R1 发布时,DeepSeek 官方曾用 deepseek-reasoner 提供 R1 API。随后该别名指向过其他新版本;官方更新日志记载,旧的 deepseek-chat 与 deepseek-reasoner 名称计划于 2026 年 7 月退役。截至本文更新日,官方模型页列出的 API 模型是 deepseek-flash 与 deepseek-v4-pro,两者均支持思考与非思考模式。因而不能在当前教程里写“调用 deepseek-reasoner 就是调用 2025 年的 R1”。现在选 API,应查当时的模型页和思考模式文档,核对具体模型、模式、输出字段与计费规则;本文讨论 R1 的历史研究设计,不给会变动的价格或性能数字。
对于分书题,系统可以先用快速模式作答,再用程序校验 总数 与 转移后相等 两条规则。若是更难的约束题,且缺少便宜的确定性求解方法,可以给推理模式更多时间与 token 预算。无论采用哪种模式,遇到法律、医疗、财务等高风险决策,模型输出都只能是待验证材料,关键事实与执行条件要交给可信来源、程序规则或有资质的人复核。
面试时可以这样回答
DeepSeek-R1 是 DeepSeek 基于 DeepSeek-V3-Base 训练的推理模型。R1-Zero 先证明了基座模型在没有前置 SFT 的情况下,经大规模 RL 也能出现较长的推导和自检,但它有重复、可读性与语言混用问题。正式 R1 加入冷启动示例,并经过两轮 SFT 和两轮 RL,兼顾解题与通用回答;R1-Distill 则是用 R1 生成的数据微调较小的 Qwen、Llama 模型。推理模型相对普通聊天模式,更强调多步解题训练,并在难题回答时可能使用更多中间计算。它并非永远更准:长推导会增加 token、延迟,也可能把错误讲得很完整,最终仍要做外部验证。今天的 DeepSeek API 已更新多代,不能把旧的
deepseek-reasoner别名直接当作原版 R1。
若追问“R1-Zero 是否完全没有人工数据”,要把阶段说清:它有预训练基座,只是在推理 RL 之前不做 SFT;“没有人工逐步推导标签”也不等于训练没有题目、规则或正确答案。若追问“多输出推导就一定更好吗”,可以用分书题回答:代回检验有用,重复十遍同一错误没用;要比较的是可验证正确率、响应时间和成本,而不只是文字长度。