跳到正文
AI 知识地图 0.18 · 2026-07-30
关于与纠错文字目录 / Search
理解原理

推理模型

把更多训练与推理时算力用于搜索、验证和修正,换取难题准确率

Reasoning Models · 推理模型 · 慢思考模型

建议 20–30 分钟 · 中级 · 需要:了解「思维链」「缩放定律」

核心命题 推理模型通过专门的后训练,让模型更会把计算预算用在拆解、搜索、验证与修正上。测试时可以给它更高的 reasoning effort:可能是一条更长的内部推理轨迹,也可能是多条候选、搜索或验证器协作。关键不是把文字写得更长,而是把更多推理时计算转化成更高的解题成功率
读完这一页,你应该能自己回答:
  • 是什么——为什么有一类模型「回答很慢」,还被当成进步。
  • vs 思维链——这不就是让模型写思维链吗,区别在哪。
  • 新的扩展轴——为什么它和「把模型做大」并列为一个大方向。
  • 代价——多想有什么代价。
  • 局限——想得越久就一定越对吗。
  1. 推理模型经后训练学会把更多计算用于拆解、搜索、验证和修正。(§1)
  2. 它与提示式思维链相关,但原始轨迹可以隐藏,计算也不只是一条长文字链。(§2)
  3. 测试时缩放可以增加轨迹长度、候选数、搜索或验证;收益随任务而异并会递减。(§3)
  4. 预算要按任务价值、难度与可验证性分配,收益通常递减。(§4)
  5. 代价是慢、贵、占窗口,简单任务不值得。(§5)
  6. 但想得久不等于一定对;候选覆盖、验证器、停止规则和证据都可能失败。(§6–7)

1什么是推理模型直觉

日常使用的聊天模型在接到问题时,通常带着一份相对固定的计算预算,沿着最直接的路径生成答案。预算在这里指模型解码时实际投入的算力:生成多少个 token、进行多少步计算。普通模型对简单问题和困难问题一视同仁地"写下去",遇到需要多步推导、多条路径比较的题目时,就很容易在中途出错而不自知。

推理模型的不同之处在于训练阶段。它经过专门的训练后处理,学会了根据问题的难度动态分配中间计算:把问题拆解成子问题、逐步演算、在遇到死胡同时换一条路径、对自己的中间结果做检查并修正。因此推理模型的"慢"不是故障,而是把更多的算力花在寻找正确解答的过程上。经验上,这种额外的计算预算常常能提高数学、代码以及复杂逻辑任务的成功率。

这里有一个容易被界面误导的地方:"思考"并不等于展示给用户的文字。有些开放模型会返回完整的推理轨迹,用户能看到它每一步的演算;有些产品则隐藏原始轨迹,只给最终答案或简短摘要。无论界面上有没有"思考过程"这一栏,都不能据此判断模型内部是否使用了推理计算——隐藏轨迹的产品完全可能在内部做了大量拆解、搜索和验证,而只把结论交出来。

从输入与输出的角度看,推理模型接收的是一个待解决的任务,以及与之配套的资源:可用的推理预算、可供调用的候选解生成方式和验证工具。它输出的不是"凭感觉写下的一段话",而是经过拆解、搜索、检查和修正之后的答案。支撑这一切的关键是训练阶段的专门处理:模型学到的是把额外计算真正投向难题的求解过程,而不是单纯把可见的解释文字写长。原始轨迹可能展示也可能不展示,但内部的计算过程才是推理模型与普通模型的分界。

适用范围与边界同样值得明确。额外预算在数学、代码等结构化程度高、答案可验证的任务上常有明显收益;而在其他类型的任务上,收益取决于任务性质、模型本身的能力以及预算规模。没有任何机制能保证"想得越久就一定越对",推理模型提升的是成功率的期望,而不是对每一道题的正确性承诺。

2它和思维链什么关系综合

"先想再答"听起来和思维链(Chain-of-Thought)几乎是一回事,二者也确实关系密切,但分界点在于一个问题:是谁让模型去想的。

思维链是一种提示技巧。触发它的是提示本身——在提示里给出分步推理的示例,或者直接要求模型"一步步来"。模型接到这样的指令后,把原本一次成形答案的过程展开成可见的中间步骤。它的能力来源主要是预训练阶段就已经沉淀在模型里的知识:模型本来就会推理,思维链提示只是把这些能力显式地调出来。计算方式上,它通常生成一条可见的中间步骤轨迹,用户能看到每一步。

推理模型则是另一条路径。让模型去想的机制被训练进了模型本身:通过强化学习、可验证奖励、过程监督或结果监督等后训练手段,优化的是模型分配推理预算的策略,而不是靠一次提示临时改变行为。使用时,模型和服务提供推理预算或努力等级,模型自己决定在难题上多算几步、在简单题上少花力气;而且原始推理轨迹不一定展示给用户。在计算方式上,推理模型可以走一条更长的单轨迹,也可以结合多样采样、搜索、验证甚至调用工具,选择远比"把中间步骤写出来"丰富。

把两者对照起来看,差异分布在四个维度上。触发方式:思维链靠提示中的示例或"分步"要求,推理模型靠服务提供的预算与努力等级。能力来源:思维链主要利用预训练已有能力,推理模型靠后训练学到的策略。计算方式:思维链通常只有一条可见的中间步骤链,推理模型可以使用多候选、搜索、验证与工具。轨迹可见性:思维链的中间步骤直接呈现,推理模型可能隐藏原始轨迹。

因此,一句话概括:思维链是用提示引出中间步骤,推理模型则是通过后训练学会怎样更有效地使用推理预算。二者相关但不可等同,而且可以组合使用——一个经过后训练的模型同样可以接受思维链式提示。一个容易混淆的推论也随之而来:输出一段很长的解释,既不是推理模型的充分条件,也不是必要条件。普通模型也能被提示着写出冗长的"思考",而真正的推理模型可能只回一句简短结论,内部却已经搜索验证过许多条路径。

思维链(提示技巧)推理模型(训练进模型)
怎么触发提示中给推理示例或要求分步模型和服务提供推理预算/努力等级,不一定展示原始轨迹
能力从哪来主要利用预训练模型已有能力用强化学习、可验证奖励、过程/结果监督等后训练优化推理策略
计算方式通常生成一条可见的中间步骤可用更长单轨迹,也可结合多样采样、搜索、验证或工具

3测试时缩放:数值例子直觉

过去让模型变强,主流的做法是预训练缩放:把参数量、训练数据量和训练算力在训练阶段同步做大,沿着缩放定律向前推进。这条路仍然有效,但代价越来越高——训练成本持续攀升,而高质量的可用数据正在接近上限。推理模型开辟的是第二条轴:测试时缩放(test-time scaling)。它不改变训练,而是在回答时对同一个模型或模型系统投入更多算力,具体手段包括延长单条推理轨迹、采样多条候选答案再投票、在解空间中做搜索、调用工具验证,或者让一个验证器筛选候选。更多计算在许多难题上确实能提高准确率,但通常伴随收益递减;如果搜索策略本身不对,额外算力也可能被白白烧掉。

多候选为什么可能有用,可以看一个纯直觉性的数值例子。假设每条候选答案彼此独立,且单条候选做对的概率为 35%(p = 0.35)。采样 4 条候选时,4 条全部做错的概率是 (1 − 0.35)⁴,因此"至少有一条正确"的概率为:

1 − (1 − 0.35)⁴ ≈ 82%

单条只有 35% 的把握,多采几条后"里面有一条对的"这件事就变得相当可靠。但这里引入了第二个环节:验证器。候选里藏着正确答案,不等于系统最终能把它挑出来。假设验证器在正确答案存在时有 80% 的概率选中它(q = 0.80),那么端到端的上限大约是:

0.82 × 0.80 ≈ 66%

也就是说,为了从 35% 提到约 66% 的上限,系统付出了接近 4 倍的计算。这个例子的每一步含义需要仔细读:82% 是"至少一条候选正确"的概率,它只依赖于候选的覆盖能力;80% 是验证器在正确候选存在时选中它的概率,它刻画筛选环节的可靠性;66% 是两者相乘得到的端到端上限,含义是覆盖再全,最终仍会被验证器的失误截断。

图 1 展示的就是这条权衡:普通模型接到问题直接作答,推理模型则先投入较长的思考再给出答案,用回答时多花的计算换取更高的准确率。需要注意,长推理只是测试时缩放的实现方式之一;多候选采样、搜索和验证同样属于测试时缩放。

把这个例子的输入与输出抽象出来:输入是单条候选做对的概率 p、候选数量 k、候选之间的相关性,以及验证器选中正确候选的概率 q;输出是额外计算下的端到端成功估计。独立假设下的核心式子就是 1 − (1 − p)^k,代入 p = 0.35、k = 4 得到约 82%,再乘 q = 0.80 得到约 66% 的上限。边界也很明确:真实世界里的候选答案高度相关——同一模型用相似思路采样出的多条答案往往一起对或一起错——所以实际收益通常低于独立假设给出的数字。这个数值的作用是建立预算直觉,而不是性能保证;真正要提升,需要验证器更准和候选更多样两件事同时发力。

普通模型 问 → 答(秒) 快,但难题常错 推理模型 问 →〔长思考〕→ 答 慢,但难题上更准
图 1 用回答时计算换准确率。长推理只是其中一种实现;多候选、搜索和验证同样属于测试时缩放。

4预算怎样分配才值得:逐步演算推导

多想一次能带来多少新增的成功,这些新增是否值得付出的额外延迟与费用?这可以用一个期望效用式子来量化。设 b 为推理预算——它可以是候选数量、搜索步数或推理努力等级。预算为 b 时任务成功的概率记为 P_success(b),成功带来的价值记为 V,而预算带来两类成本:计算成本 C_compute(b) 和延迟成本 C_latency(b)。那么预算 b 的期望效用就是成功收益减去两类成本:

U(b) = P_success(b) × V − C_compute(b) − C_latency(b)

这个式子的含义是:加预算会抬高成功概率,从而抬高期望收益,但同时也在烧算力、拖慢响应。真正该看的不是"加预算有没有帮助",而是再增加一档预算带来的边际效用——新增的成功收益减去新增的成本——是否还为正。

用一个教学用的简化例子感受收益递减。假设同一批 100 道题,预算从 1 档增至 4 档时,正确数从 48 道升到 67 道:额外 300 单位计算换来 19 道新做对的题,边际上每道约 16 单位计算。再把预算从 4 档增至 8 档,正确数只从 67 升到 70,多 3 道题,却要再花 400 单位计算,每道新增的正确题超过 130 单位。这个例子不代表任何特定模型,但它展示的规律是普遍的:前期预算投入产出高,后期越来越贵、收效越来越小。既然如此,合理的系统就应当按题目难度、可验证性和错误代价来路由预算,而不是给所有请求都分配同一档最高预算。

按任务性质分配预算,可以对照下面这组情形:

这张表的逻辑主线是"可验证性决定预算价值"。当答案可以被单元测试、代回或形式规则快速判定对错时,多候选搜索多花的算力能迅速兑换成成功率的提升,预算就值得花;而当不存在外部真值信号时,延长同一个模型的思考往往只是把错误打磨得更完整、更自信,预算的价值大打折扣。冷门事实题是后者的典型:模型想得再久,也变不出它本来不知道的证据,此时更有效的做法是检索、引用,或者直接拒绝回答。高影响决策的教训稍有不同:增加验证是对的,但验证器若与生成端同源,就可能和它犯同样的错,所以验证环节要引入独立工具、形式规则和人工复核,而不是单纯堆砌推理长度。

任务建议预算理由主要验收
改日期格式低:单次生成简单、可确定性检查模式匹配与样例测试
竞赛数学题中高:多候选+验证难但答案常可验证代回、符号计算或证明检查
冷门事实问答推理预算不是主旋钮多想不能创造缺失证据检索、引用与拒答
高影响决策按风险增加验证而非只加长度验证器也可能同源犯错独立工具、规则与人工复核
U(b)=Psuccess(b)×VCcompute(b)Clatency(b)

5代价工程

推理预算不是免费的,它具体花在三类地方。首先是慢和贵:更长的推理轨迹、更多候选答案、额外的验证环节,每一项都在增加计算量、响应延迟和账单费用。其次是资源占用:无论推理 token 是展示给用户还是被隐藏,候选轨迹和工具调用的结果都实实在在地消耗推理预算;至于这些消耗是否计入对用户公开的上下文,不同服务由各自的实现决定,使用前需要按具体接口确认。第三类代价体现在机会上:并不是所有任务都值得付出这些成本。像"把今天的日期格式化一下"这类简单请求,强行让它长思考纯属浪费——更慢、更贵,答案却不会更好。

因此合理的做法是"因题施策"。困难的多步推理任务——数学、代码、复杂逻辑——是推理模型最划算的用武之地,因为预算带来的成功率提升足以覆盖成本;而日常的简单问答用普通模型单次生成即可。很多产品正是这样做的:按问题难度自动切换是否进入"多想"模式,而不是对所有请求统一开启最大推理。

把代价分析工程化,它的输入包括轨迹长度、候选数量、验证次数、工具调用次数、延迟 SLO 和任务难度;输出则是费用、响应时间、资源占用以及据此做出的路由选择。路由的结论与预算分配一节一致:简单格式化走单次生成,难数学题启用多候选加验证,高影响任务增加独立检查而不是只把文字拉长。一个具体的工程提醒是:服务对隐藏推理 token 的计费方式和对上下文窗口的处理方式各不相同,不能凭公开界面的表现想当然,必须按实际使用的接口测量。

6局限:想得久 ≠ 一定对工程

把高预算当成正确性的保证,是使用推理模型时最需要警惕的直觉错误。测试时缩放的收益建立在两个前提上:搜索的方向基本正确,验证环节能够识别好坏。一旦这两个前提崩塌,增加计算只会放大错误——模型可能在错误的前提上搜索得更深、更自信,验证器也可能被"看起来合理"的答案骗过,从而把错误的候选一路保送到输出端。

可见性在此处制造了额外的盲区。推理模型展示给用户的解释,并不保证忠实反映它内部的全部计算;界面上的"思考过程"可能是摘要、改写,甚至与真实计算路径相去甚远。反过来,隐藏了原始轨迹的产品,用户连直接审计的入口都没有。因此无论轨迹展示与否,都不应该用"它看起来想得很认真"来背书答案。

正确的验收方式要按任务类型独立执行,而不是依赖模型自身的宣称。数学结论应当独立验算,比如把答案代回原式;代码应当真的执行测试,而不是读一眼就觉得对;事实性陈述应当核对来源,而不是相信模型说得越详细就越可靠。把这些手段组织成一次局限判断的流程:输入是搜索前提、候选覆盖、验证器的独立性、可用的外部证据和最终测试,输出则是四个可选结论——接受该答案、继续搜索、改走检索,或者直接拒答。当模型沿着错误前提越搜越深、验证器与生成端同源犯错时,这套外部验证就是唯一能拦住错误的闸门。

7失败发生在哪一层诊断

"给了高预算还是答错"并不是一种单一故障,而是一整条流水线中的某个环节失效。要修复它,得先定位失败发生在哪一层:候选覆盖、候选相关性、验证器选择、停止规则,还是证据缺失。每层都有自己可观察的现象和对应的优先修复项:

这张表给出的诊断顺序是:先查正确候选是否出现,再查出现之后是否被选中。如果采样了无数次都没见过正确路径,问题出在候选覆盖上,该改的是模型能力、提示、工具或任务分解策略;如果多条候选只是换了措辞却共享同一个错误,那是候选相关,需要提高采样多样性或引入异构方法;如果正确候选在场却被错误答案压过,那是验证器选择的失误,该补的是验证数据、过程检查和独立规则。停止规则单独成一类:过早停止会漏掉还没出现的正确解,而过晚停止则是在没有边际收益的情况下继续烧算力,两种都要求系统按边际收益、置信水平和硬预算上限来决定什么时候收手。最后一类是证据缺失——答案逻辑自洽,但其事实前提根本无从核验。此时正确的动作是去检索、调用工具或者拒答,而不是让模型继续内省,因为内省产生不了外部世界的信息。

需要额外澄清的是验证器的地位:它并不是真理的裁判。过程监督确实能帮助定位中间步骤的错误,但验证器本身也受训练分布、覆盖范围和偏差的限制,和生成端一样会犯错。因此生产环境的评测应当分开记录两个指标:正确候选是否出现,以及出现之后是否被选中。把这两件事拆开,才能知道下一份预算应该花在生成端还是验证端。整条诊断流程的输入是全部候选、候选间的差异、验证器的排序、停止时点、预算曲线和外部证据;输出是对上述五个失败层的归因。先查"有没有对的",再查"选没选对的";没有候选就修模型与分解工具,有候选未选中就修验证器。

失败层可观察现象优先改什么
候选覆盖采样很多次都没有正确路径模型能力、提示、工具或分解策略
候选相关多条答案换措辞但共享同一错误提高采样多样性或引入异构方法
验证器选择正确候选存在却被错误答案压过验证数据、过程检查与独立规则
停止规则早停漏掉正确解,或无收益仍继续烧算力基于边际收益、置信与硬预算停止
证据缺失逻辑连贯但事实前提不可核验检索、工具或拒答,而非继续内省

8把整条因果链连起来综合

把各环节串成一条完整的因果链,推理模型的整个逻辑就清晰了。

链条的起点在后训练。推理模型经过专门的后训练,学会把更多的计算投向拆解、搜索、验证和修正,从而在难题上动态分配推理预算。这把它与提示式思维链区分开来:二者相关,但推理模型的计算策略是训练进模型本身的,原始轨迹可以被隐藏,计算形式也不只是一条拉长的文字链,还可以是多候选、搜索、验证与工具调用。

这个能力落到回答阶段,就是测试时缩放:通过增加轨迹长度、候选数量、搜索深度或验证次数,在回答时投入更多算力换取准确率。收益随任务而异,并且会递减——预算从低到中往往收效明显,再往上性价比迅速下降。因此预算必须按任务的价值、难度和可验证性来分配:简单的、可确定性检查的任务用单次生成;难但答案可验证的任务值得多候选加验证;事实缺失的任务则要靠检索、引用或拒答,而不是靠多想。这样分配的代价是真实的:更长轨迹、更多候选和额外验证带来更高的计算、延迟和费用,还会占用上下文窗口——简单任务强行长思考,只是又慢又贵还不见得更好。

链条的终点是一条提醒:想得久不等于一定对。候选覆盖不足、候选高度相关、验证器选错、停止规则失当、事实证据缺失,其中任何一环断裂,高预算都会放大错误而非修正错误。所以数学要独立验算、代码要执行测试、事实要核对来源,验证器只是环节之一,不是真理的裁判。

反过来,从终点回溯起点也能看出设计要点:生产评测要分开记录"正确候选是否出现"与"出现后是否被选中",再决定下一份预算投向生成端还是验证端;预算的每一档增减都要用边际效用来衡量,而不是默认越多越好。掌握了这条链,也就抓住了推理模型的内核:它与思维链的区别在于"谁让它想的"以及计算策略是否训练进模型;而测试时缩放之所以是一条新的扩展轴,是因为它不依赖继续做大训练,而是在回答时用算力换准确率,与预训练缩放并列成为提升模型能力的方向。

9概念依赖与延伸学习路线

把这一页放进更大的概念地图里,它的位置是清楚的。

先修概念有三个:思维链 CoT、大语言模型、缩放定律。思维链是本页的对照物——理解了"用提示引出中间步骤"是什么意思,才能看清推理模型把推理策略训练进模型本身这件事的差异;大语言模型提供底座能力,推理模型是对这种能力的进一步塑造;缩放定律则交代了背景——当预训练缩放越来越贵、数据越来越稀缺时,测试时缩放才有资格被称为一条新的扩展轴。

本页的核心概念构成一个相互咬合的簇:推理后训练回答了能力从哪里来;推理预算刻画了回答时投入的计算量;长轨迹、多候选、搜索与验证是预算的具体花法;隐藏 CoT 提醒了"界面可见性"与"内部计算"的区别;收益递减则给预算设定了经济学上的边界。这五个概念串在一起,就是推理模型从训练到部署的完整逻辑。

紧邻的延伸方向有四个。RLHF(基于人类反馈的强化学习)与推理后训练同属后训练家族,对照它能看清奖励信号和监督方式如何影响模型行为;自洽性(self-consistency)正是多候选加投票思想的直接延伸,本页的数值例子可以平滑过渡过去;思维树(Tree-of-Thoughts)把"一条轨迹"扩展为显式的搜索树,是搜索式测试时缩放的深化;上下文窗口则是工程上的紧约束——所有可见或隐藏的推理 token 都要占用它,推理越长,窗口与费用问题越突出。

更远一点的延伸同样由本页的概念自然导出:合成数据与推理模型的训练数据问题相关;评测承接"生产环境要分别记录正确候选是否出现、是否被选中"的工程要求;可解释性承接"可见解释未必忠实反映内部计算"的盲区;Agent 则是推理模型加上工具调用后的自然下一步——本页里"验证"和"工具"的线索,在那里会展开成完整的行动能力。

学习层级涉及概念
先修思维链 CoT、大语言模型、缩放定律
本页核心推理后训练、推理预算、长轨迹/多候选/搜索/验证、隐藏 CoT、收益递减
紧邻延伸RLHF、自洽性、思维树、上下文窗口
更远合成数据、评测、可解释性、Agent