自洽性:用多条独立推理路径投票
理解采样多样性、答案聚合、相关错误、成本与置信估计,并区分多数一致和事实正确。
- 同题随机采样多条路径
- 保留适度多样性
- 抽取并规范化最终答案
- 多数或加权聚合
- 外部验证共识
- 按边际收益提前停止
1一条路径为何脆弱直觉
大模型逐词生成文本。做多步推理题时,模型沿思维链一步一步输出,每一步都以之前生成的全部内容为条件。因此,早期的一次推理选择——用哪条公式、走哪一个分支、把哪个量当作已知——会决定后面所有步骤的去向:早期选错,后续便全部沿着错误路径继续,最终答案随之出错。
关键在于,采样解码本身带有随机性。同一个模型、同一道题,再采样一次,早期可能做出不同的分支选择。这正是“同一模型换一次采样为什么可能算对”的答案:正确路径并非模型够不到,只是上一次采样没有随机选中它。
自洽性把这一观察变成一种方法:对同一个可多路径求解的问题独立采样多次,产生多条候选推理路径。若正确路径在样本集合中比任何单条错误路径更常出现,那么对最终答案做多数投票,就可以压低单条路径偶然出错的影响——一次早期的随机分支错误只污染它所在的那一条路径,而更常出现的正确路径有机会在投票中胜出。自洽性针对的是单路径偶然错误。
自洽性的输入包括:一个可用多条路径求解的问题、采样配置(温度、采样数量等)与聚合规则(如对规范化后的答案做多数投票)。输出包括:多条推理路径、规范化后的答案簇,以及聚合结果。
它的边界同样明确:若多数采样路径共享同一种偏差——例如它们全都相信同一个错误前提——那么投票依然会选错。自洽性只能纠正分散在个别路径上的随机错误,无法修复所有路径共同相信的错误前提。
2投票的概率直觉数学
自洽性把“多条路径里多数同意谁”当作最终答案,其可靠性可以用一个简单的投票模型刻画:每条路径有独立的正确概率 p,共采样 n 条路径(n 取奇数以避免平票),求多数票正确的概率。
若各条路径的错误近似独立,则 n 条路径中正确的条数服从参数为 (n, p) 的二项分布。多数正确意味着正确条数至少为 (n+1)/2,因此
P(多数正确) = Σ 从 k=(n+1)/2 到 n 的 C(n,k) × p^k × (1−p)^(n−k)
这个式子说明了全部关键现象。当 p > 0.5 时,正确条数的分布集中在 np > n/2 的位置;随 n 增大,多数落在正确一侧的概率单调上升并趋近于 1,投票把单条路径的微弱优势放大成几乎确定的正确。反过来,当 p < 0.5 时,分布集中在 n/2 以下,n 越大,多数反而越确定地错——投票放大的是信号本身,信号是错的,放大的就是错误。若各条路径的错误高度相关,例如它们共享同一套错误前提,那么新增样本携带的新信息很少,n 增加带来的收益迅速饱和,投票不会可靠改善。
因此,这个概率直觉的输入是单路径正确率 p、奇数样本数 n 与路径独立性假设,输出是多数票正确的概率。结论分三种情形:p > 0.5 且错误近似独立时,增加 n 通常提高多数正确率;p < 0.5 时,增加 n 只会强化错误;错误相关性高时,收益随 n 饱和。
这一结论描述的是理想化投票模型下的概率行为。它依赖“路径近似独立”的假设,且 p 本身无从直接得知;它说明投票在什么条件下值得做,而不是对某个具体答案的事实正确性给出保证。
3多样性与质量的温度采样
自洽性需要多条彼此不同的推理路径,而路径差异的来源是采样解码中的随机性。温度是控制这种随机性最直接的旋钮:它作用于模型输出的下一个词概率分布,温度越低,分布越尖锐,模型几乎总是选概率最高的词;温度越高,分布越平坦,低概率的词也有机会被选中。
温度为零意味着确定性解码。每一步都取概率最高的词,同一条路径会被逐字重复,采样十次得到的也是十份一模一样的推理,投票退化为单路径,自洽性失去意义。适度升温后,早期分支开始出现差异,正确路径和各类错误路径都有机会被采到,这才有投票的空间。但温度过高时,分布接近均匀,模型会大量选中在推理语境里不合理的词,产生断裂的步骤、无效的推导或无法解析的答案,候选集的质量随之崩塌。多样性与质量之间存在张力:太冷没有多样性,太热没有质量。
另一个常用旋钮是 top-p 采样,它把候选词截断到累计概率达到 p 的最小集合,只在这个集合内采样。温度重塑整个分布的形状,top-p 削掉长尾,两者作用不同,通常需要连同样本数量一起考虑。工程上不会单独调某一个参数,而是在任务集上联合调节温度、top-p 与样本数上限,并持续监控两个信号:规范化后独特答案的数量,以及解析失败、推理中断的比例。前者过少说明路径没有真正分开,后者过高说明随机性已经伤害质量。
这一环节的输入是温度、top-p、样本上限、单路径有效率与答案多样性,输出是一组质量可用且机制不同的候选路径。多样性的目的是让各路径的错误尽量不相关,从而让投票接近独立样本的情形;它不等于越随机越好。超出解相关所需的那部分随机性,只会消耗更多采样预算并制造无效推理。
4答案如何规范化聚合
投票的对象是最终答案,而不是各条路径写下的自由文本。不同推理路径可能用不同的表面形式表达同一个答案,直接按字符串计票会把同一答案拆成多个候选,因此计票前必须把答案规范化成可比较的等价簇。
规范化的做法取决于任务类型。数学题可以先解析最终答案的结构,再按规则化简和换算:1/2 与 0.5 是同一数值的两种写法,50% 与 0.5 是同一定义的比例表达,0.5 m 与 50 cm 是同一长度的两种单位;这些表面不同、语义相同的答案应归入同一个簇。分类题的标签集合是固定的,规范化就是把每条路径的答案映射到唯一标签上,映射规则本身即等价规则。开放问答没有有限标签集,需要语义聚类或验证器来判断两个表述是否等价,例如用嵌入相似度或让模型逐对判定。
规范化的粒度直接决定每种答案最终获得多少票。粒度太细会把等价答案拆开,本来应当合并的一簇被分散成多簇,正确票被稀释,可能让票数更少的错误答案胜出;粒度太粗会把实际不同的答案并进同一簇,人为抬高该簇的票数。聚合器本身的错误同样以这两种形式出现:错误拆分或错误合并。
这一环节的输入是每条路径的最终结构化答案、单位、数值形式与任务等价规则,输出是可参与投票的等价簇,以及解析失败的记录。无法解析成结构化形式的答案不能进入计票,应单独统计并监控其比例,因为它反映的是上游采样质量的下限。规范化规则总是与任务绑定,不存在放之四海皆准的换算表;同一套规则在一个任务上正确,在另一个任务上可能恰好制造拆票或并票。
5共识不是事实边界
十条路径给出同一个答案,只能说明这个采样过程稳定地偏好该答案,不能说明该答案符合世界事实。投票统计的是模型行为的内部一致性,而错误的来源常常位于所有路径共享的那一层:训练数据里的同一处偏差会被每一条路径继承;同一个被记错的公式会在每条推导中被重复调用;提示词的某种措辞暗示也会把所有路径推向同一个方向。这些相关性使“十条路径”在信息上接近“一条路径重复了十遍”,票数高而证据量并没有增加。
要打破这种相关错误,需要改变的不是样本数量,而是路径的来源。外部计算器可以直接验证算术步骤,检索可以核对事实性陈述,单元测试可以检验代码路径声称满足的约束,独立规则或另一个模型可以交叉检查推理前提。这些外部验证与“再采一条同模型路径”不同:它们的错误与模型的训练偏差不共享同一个来源,因此携带真正的新信息。对同模型样本而言,增加数量不能消除共享偏差,更换来源或引入验证工具才是更有效的升级。
因此,对共识结果的解释需要同时考虑票数与路径来源。输入不仅包括票数分布,还包括这些路径来自同一模型还是多个模型、提示是否单一、是否存在外部证据;输出是对共识强度的判断,以及是否需要外部验证或拒答的决定。高影响的结论不应以“多数路径同意”为终点,而应经过计算、检索、测试或独立规则核验后再给出。
6成本与停止工程
采样 n 次意味着付出 n 倍的推理成本,而新增一条路径的边际收益随 n 递减:多数正确的概率一旦接近其上限,再多采样只带来微小的提升。因此“每题固定采样 40 次”通常不是好的默认设置——它会让简单问题白白多付几十份推理费,又可能让难题在 40 次里仍然没有拿到足够票差。
更合理的做法是逐步采样:每次采一小批路径,计票,再根据当前状态决定继续还是停止。停止的条件有几种:外部验证器已经通过,说明答案不依赖票数而成立;票差已经大到足以在给定置信要求下做出决定;或者继续采样的预期收益低于其成本、剩余预算耗尽。反之,如果票差很小且验证未通过,就继续加采或放弃回答。这一决策的输入包括当前票差、有效样本数、验证结果、剩余预算、任务价值与错误成本;输出是五种行动之一:继续采样、停止并回答、验证领先答案、拒答、升级到人工。
启用自洽性本身也应有门槛:只对高价值、答案可规范化聚合、且单次运行不稳定(同题多次采样答案分散)的任务启用,否则聚合无从谈起,成本也没有回报。启用之后,应当报告质量—成本曲线,即准确率随采样数如何变化,让付出的预算有据可查。
还需注意,票占比是未经校准的信号。8/10 的一致只表示十条路径里有八条同意,并不等于该答案有 80% 的正确概率;共享偏差与路径相关性使票占比不能直接映射为可信度。因此停止决策应依赖票差与验证结果,而不是把票占比当作概率直接使用。
7完整手算:独立正确率0.6时五票多数有多可靠逐步演算
设每条路径彼此独立,单路径正确率 p = 0.6,共采样五条路径,问多数(至少三条)正确的概率是多少。这个手算的输入就是独立单路径正确率 p = 0.6,输出是五条中至少三条正确的概率 P多数。
“至少三条正确”由三种互斥情形组成:恰好三条正确、恰好四条正确、恰好五条正确。每种情形的概率按二项式逐项计算:恰好 k 条正确有 C(5,k) 种组合方式,每种方式的概率都是 0.6^k × 0.4^(5−k)。
恰好三条正确:C(5,3) = 10,10 × 0.6³ × 0.4² = 10 × 0.216 × 0.16 = 0.3456 恰好四条正确:C(5,4) = 5,5 × 0.6⁴ × 0.4 = 5 × 0.1296 × 0.4 = 0.2592 恰好五条正确:C(5,5) = 1,1 × 0.6⁵ = 0.07776
P多数 = 0.3456 + 0.2592 + 0.07776 = 0.68256 ≈ 68.3%
多数正确率从单路径的 60% 提升到约 68.3%,提升是真实的,但幅度远小于五倍。每一票的边际贡献随 n 递减,投票的作用是把单路径上微弱的正确优势逐步放大,而不是把可靠性与路径数相乘。
把 p 换成 0.4 再算一遍,同样三项相加得到 0.2304 + 0.0768 + 0.01024 = 0.31744 ≈ 31.7%。单路径本来略偏错误时,多数反而更确定地站在错误一边——采样不是必然的增益,方向取决于 p 是否大于 0.5。若五条路径的错误高度相关,比如共享同一套错误前提,那么它们携带的独立信息远少于五份,有效样本数小于 5,上面的公式不再适用,实际多数正确率会明显低于 68.3%。
三种条件对应的结论可以归纳为:p > 0.5 且错误较独立时,多数准确率随样本数上升;p < 0.5 时,多数更可能错;错误高度相关时,增加样本的收益快速饱和。
| 条件 | 增加样本的结果 |
|---|---|
| p>0.5、错误较独立 | 多数准确率上升 |
| p<0.5 | 多数更可能错 |
| 错误高度相关 | 收益快速饱和 |
8原创图:多路径只有经过规范化与验证才形成答案可视化
图 1 把自洽性的完整流程画成一条从左到右的可审计链路,并说明为什么“采样十条思维链”不等于“十个独立证人”。
链路的起点是同一个问题,向下分出多条采样路径。进入聚合之前,第一步是抽取每条路径的最终答案,而不是保留整段推理文本:内部推理文字写得再长,也不会为这一票增加权重,投票的对象只是被抽取出来的答案。第二步是规范化与合票,把 1/2 与 0.5 这类表面不同、语义相同的答案并成同一簇,保证等价答案的票不被拆散。第三步才是投票,产生多数结果。流程并没有在投票处结束:多数结果还要经过外部验证——用计算核对数值、用检索核对事实、用测试核对代码、用独立规则核对约束——之后才输出最终答案,同时输出验证状态和各阶段的追踪记录。
这张图的输入是同一问题的多条路径、答案规范化器、投票器与外部验证器,输出是最终答案、验证状态与阶段追踪。它表达的正是这条因果链:多路径只提供候选与票数,规范化决定票怎么合,外部验证决定多数结果是否可采信;三个环节缺一不可。之所以说这不是十个独立证人,是因为所有路径出自同一个模型,共享同一套训练偏差和采样过程,它们在统计上高度相关;图中从投票指向外部验证的那一步,正是对这种相关性的回应。整张图描述的是一条可审计的搜索流程,而不是十个互不相关的旁观者。
9相关错误决定有效样本数相关性
五条路径都调用同一个错误公式时,投票不会带来任何帮助,因为它们的错误是相关的:共享的模型权重、同一份训练数据、同一条提示与相近的解码前缀,使这些路径在犯错时倾向于一起犯、犯同一种错。投票依赖“错误近似独立”的假设,相关错误直接削弱这一假设。
相关性对投票收益的影响可以用方差量化。设单条路径答案误差的方差为 σ²,任意两条路径误差之间的相关系数为 ρ,那么 n 条路径等权平均后的误差方差近似为 σ² × (1 + (n−1)ρ) / n。当 ρ = 0 时,方差等于 σ²/n,随 1/n 下降,这正是独立投票的收益;当 ρ = 1 时,方差等于 σ²,n 再大也完全不降——所有路径给出同一个偏差,平均并不能消除它。介于两者之间的 ρ 表示收益打了折扣。
把折扣后的方差换算成“相当于多少个独立样本”,就得到有效样本数的近似式:
n_eff = n / (1 + (n−1)ρ)
以 n = 10、ρ = 0.5 为例,n_eff = 10 / (1 + 9 × 0.5) = 10 / 5.5 ≈ 1.82。名义上采了十条路径,实际只相当于约 1.82 个独立样本的降方差效果,多付的推理成本大部分被相关性吞掉了。
这一分析的输入是名义样本数 n、路径错误相关系数 ρ 与单路径方差,输出是有效样本数 n_eff。降低 ρ 的途径是增加机制多样性:换用不同的提示分解方式、引入不同的工具、使用不同模型家族、补充检索证据,让各路径的误差来源不再重合。同时要防止聚合器本身制造偏置,例如投票规则若偏爱冗长答案或同一来源的答案,相当于人为引入了新的相关性。还要记住 ρ 只是一个近似摘要:真实路径之间的相关性不会恰好用一个数字描述,n_eff 是理解收益饱和的模型,不是精确的样本计数。
10顺序采样可用票差和验证结果提前停止成本控制
固定采样次数把简单题和难题一视同仁,顺序采样则把“何时停”变成一个在线决策:先取少量样本,规范化答案并计票,然后检查停止信号,命中即停,未命中就再采一批,直到预算上限。
可用的停止信号有四类,各自的优点与风险不同。固定票差最简单:领先答案与第二名之间的票差达到预设阈值就停止,但它完全不考虑路径错误的相关性,票差再大也可能只是同一种偏差的重复。序贯统计界提供显式的误差控制,用统计边界判断是否已经有把握做出决定,但它的保证依赖独立性等假设,假设不成立时边界失效。验证器通过是最强的信号之一,因为它在票数之外引入了外部证据,用计算、检索、测试或规则核验领先答案,但验证器自身可能有盲区。边际收益信号直接权衡成本与收益,当下一批采样的预期收益低于其成本时停止,代价是需要在线估计收益,估计本身会引入噪声。
顺序采样的输入是当前规范化票数、相关性估计、外部验证结果、冻结的停止边界与预算,输出是五种动作之一:继续采样、停止并回答、验证领先答案、拒答、升级到人工。其中阈值必须先在冻结的开发集上按任务价值和错误成本调好,部署后不再改动;任何把票占比直接当作概率的用法都会引入未校准的置信度。当独立性等假设不满足时,固定票差类信号并不能提供任何误差保证,此时更应依赖外部验证或转人工,而不是继续加采样。
| 停止信号 | 优点 | 风险 |
|---|---|---|
| 固定票差 | 简单 | 未考虑相关性 |
| 序贯统计界 | 显式误差控制 | 假设可能不成立 |
| 验证器通过 | 使用外部证据 | 验证器漏洞 |
| 边际收益 | 直接权衡成本 | 需在线估计 |
11端到端案例:不是“十次生成”,而是一条可审计的搜索流程案例推演
一道药物剂量换算题可以完整展示自洽性在质量、风险与成本之间的逐步决策。整个流程的输入是一道要求“数值+单位”输出的题目、题目所需的必要变量、首批三条采样路径、单位规则与范围检查规则,以及最多五条路径的预算;输出是结构化答案、验证结果,或专家升级。
第一步,先定义答案空间。最终输出必须包含数值与单位,因此在任何采样之前就把 mg 与 g、每日剂量与每次剂量的单位换算关系确定下来。如果题目缺少必要变量,比如没有体重,就无法换算每次剂量,此时答案应直接归为“信息不足”——不能让聚合器对不完整信息硬投票。
第二步,生成首批 3 条路径。采用适度温度,并要求每条路径给出可执行的算式。需要注意的是,聚合环节只读取每条路径最终的结构化答案,冗长的推理文字不获得额外票权。
第三步,合票与验证。假设两条路径给出 20 mg、一条给出 200 mg,票差看起来已经足够;但剂量任务的错误成本极高,票差不能单独作为决策依据,仍要调用单位检查器和范围规则核验。若 20 mg 通过核验,就输出答案并附上计算依据;若核验失败,不继续复制同一种解法,而是换用不同的分解提示再采 2 条路径,以改变路径的机制来源。
第四步,停止。若采到 5 条路径仍没有通过验证的共识,就拒绝自动回答并转交专家,而不是继续投票。整个过程里,样本数、所用提示、规范化动作、验证结果与停止原因全部写入追踪记录,使这条流程事后可审计。
各阶段的观测量与失败动作也可以固定下来:采样阶段看独特答案数与无效率,失败时调整温度或约束输出格式;规范化阶段看解析失败与单位冲突,失败时澄清输入或拒答;聚合阶段看票差与有效样本数,失败时增加机制多样性;验证阶段看规则与工具的通过率,失败时转人工而不是继续投票。
| 阶段 | 可观测量 | 失败时动作 |
|---|---|---|
| 采样 | 独特答案数、无效率 | 调整温度或约束格式 |
| 规范化 | 解析失败、单位冲突 | 澄清输入或拒答 |
| 聚合 | 票差、有效样本数 | 增加机制多样性 |
| 验证 | 规则/工具通过率 | 转人工而非继续投票 |
12怎样评测:必须同时报告单样本、聚合结果与预算实验设计
只报告“自洽性让准确率提高 3%”无法支撑上线决策,因为准确率不包含代价。若这 3% 是用 40 倍推理量换来的,把增益读成算法优势就漏掉了成本这一半信息。因此评测必须同时报告单样本表现、聚合表现与预算。
基线至少要包含四种策略:贪心单次解码、同温度单次采样、固定样本数的多数投票,以及带验证器的序贯策略。贪心单次给出无随机性的下限;同温度单次把“温度带来的波动”与“投票带来的增益”分开;固定多数票是朴素自洽性;带验证器的序贯策略才是完整系统。对每种策略报告任务准确率、平均与 P95 调用次数、token 成本、延迟和拒答率,并画出质量—成本曲线,让准确率始终与付出并排出现。
评测集还要按维度切片:答案是否可规范化、是否开放回答、验证器是否可用、题目难度如何。聚合后的总准确率会掩盖切片间的差异,例如开放回答任务上的表现可能远差于可规范化答案的任务。同时记录每条路径的最终答案、规范化簇、验证结果与停止原因,这样才能区分一次失败来自生成器、聚合器还是验证器,而不是笼统地归为“方法无效”。
调参泄漏必须杜绝:温度、样本上限与停止边界只在开发集上选择,选定后冻结,独立测试集只报告一次。关键的消融实验是在总 token 预算近似不变的条件下比较四种路径构成——“更多短路径”“更少长路径”“不同模型路径”与“同模型重复路径”。它能回答真正的问题:收益究竟来自计算量、路径多样性,还是验证器。这一评测的输入是四种策略与冻结的测试集,输出是准确率、P95 调用数、token、延迟、拒答率与质量—成本曲线。
13把因果链连起来综合
自洽性从单路径的脆弱性出发,逐步搭建起一条可审计的决策链,每一环都在回应前一环留下的问题。
起点是这样一个事实:同题再采样一次,答案可能不同。早期的一次随机分支选择会把整条推理带到不同路径上,单路径因此可能偶然出错,也可能偶然变对。既然正确路径在重复采样中更常出现,就值得对同一问题随机采样多条路径,让投票有机会把偶然错误压下去。这条链的第一环由此建立:采样必须保留适度多样性——温度过低会逐字重复同一条路径,过高则产生大量无效推理。
有了路径,还需要可比较的票。每条路径的最终答案被抽取出来,而不是整段推理文本参与计票;规范化把 1/2、0.5、50% 这类等价形式合入同一簇,粒度太细会拆票,太粗会并票。随后进行多数或加权聚合,得到共识答案。
但共识只是同一采样过程的偏好,不是事实:共享的训练偏差、同一条错误公式或提示暗示,都会让错误高度相关,票数高而信息量低。相关错误把名义样本数压缩为更小的有效样本数,投票收益随之饱和。于是聚合之后必须引入外部验证——计算、检索、测试或独立规则,用不共享模型偏差的证据核验共识;高影响结论不能以票数收尾。
成本与验证共同决定何时停止:按批顺序采样,在票差达到冻结边界、验证器通过或边际收益低于成本时提前结束,而不是每题固定采样四十次。每一环的观测与决策都被记录,使这条链从“多采样几次”变成一条可追溯、可复现的搜索流程。
- Chain-of-Thought Prompting:思维链基础
- Self-Consistency Improves Chain of Thought Reasoning:自洽投票
- Training Verifiers to Solve Math Word Problems:多候选与验证器