跳到正文
AI 知识地图 0.18 · 2026-07-30
关于与纠错文字目录 / Search
理解原理

自监督学习:让数据自己产生训练目标

统一理解自回归、遮盖重建、对比学习与自蒸馏,并追踪预文本目标怎样迁移、走捷径或错位。

核心命题 自监督学习不是“没有监督”,而是由数据及其变换自动构造输入—目标对。它把海量未人工标注数据变成训练信号,先学习可迁移表示或生成能力;但预文本损失只是下游语义、事实性与行为目标的代理,增强、负样本、数据偏差和捷径会决定模型实际学到什么。
读完你应该能:区分监督、无监督与自监督;计算一组对比学习概率;比较自回归、遮盖和对比目标;设计迁移与捷径验证。
  1. 选择原始数据与期望不变性
  2. 构造预测/遮盖/视图目标
  3. 优化代理损失并防止坍缩
  4. 冻结或微调迁移到下游
  5. 用真实切片排查捷径
  6. 审计来源、污染与目标错位

1标签不是人工写的,但目标仍然明确定义

自监督学习的关键不在于“没有目标”,而在于目标不需要人工逐条标注。给定一条原始数据 z,先用预先规定的变换规则 q 从 z 中构造模型输入 x 和自动目标 y,即 (x, y) = q(z)。参数为 θ 的模型 fθ 接收 x,产生预测 fθ(x),损失函数 ℓ(fθ(x), y) 再衡量预测与自动目标之间的差异。训练通过降低这一损失来更新 θ,因此整个过程仍有明确、可计算的监督信号,只是 y 来自数据本身。

“把一句话右移一位”之所以能产生监督信号,正是因为原句已经包含了每个位置之后实际出现的 token。模型看到前面的 token 作为 x,右移后对齐的后继 token 就成为 y,无须人再写答案。同样,被遮住的原始片段可以充当重建目标;同一张图片经过两次增强后,二者来自同一原始样本这一事实也能自动定义配对关系。规则 q 决定模型看见什么、要预测什么,因而也决定了训练信号的含义。

以三张商品图 A、B、C 为例,从 A 裁剪得到 A⁺。因为 A 与 A⁺ 来自同一商品,它们自动构成正样本对;B、C 则作为候选负样本。模型的输入是这些图像视图,输出可以是用于比较的表示,损失要求 A 与 A⁺ 的表示更接近,并与 B、C 的表示区分开。损失下降表示模型越来越能从视图变化中识别“是否为同一商品”,但它并不自动证明表示已经适合所有下游任务;学到什么仍受构造规则和数据内容约束。

因此,“监督学习”强调训练中存在目标与损失,“自监督学习”进一步说明目标由数据自身构造,而“无监督学习”是覆盖范围更宽的总称。自监督方法成立的前提,是能够设计出稳定且有意义的 q:自动生成的 y 必须与希望模型掌握的结构相关。若构造规则产生的目标过于容易、含糊,或与实际用途无关,模型即使很好地最小化 ℓ,也可能只学到无用的捷径。

误区更准确的理解
自监督没有监督信号目标由数据变换自动构造
预训练损失低就会下游好代理目标可能错位或走捷径
增强越强越好增强定义不变性,可能破坏语义
对比学习负样本越多越好false negative 与分布同样重要
无负样本方法无需防坍缩通常依靠不对称或显式方差约束
层级依赖与延伸
先修监督学习、损失函数、表示学习
本页核心自回归、遮盖、InfoNCE、坍缩
架构LLM、BERT、CLIP、MAE
治理预训练、训练数据治理、评测污染

2自回归目标把每个位置都变成训练样本预测未来

自回归训练把序列中的“下一个 token”直接当作目标。对于长度为 T 的文本,只要把输入与原文错开一个位置,每个已有前缀都能对应它后面的真实 token;不把没有前文的起始位置算作普通预测时,一段文本便可提供 T−1 个目标。模型在一次序列计算中学习这些位置,而不是只从整段文本得到一个标签。

整段文本的损失可写为:

L_AR = −Σₜ₌₂…T log pθ(xₜ ∣ x<ₜ)

其中,L_AR 是整段序列的自回归损失,T 是 token 总数,t 表示当前预测位置,Σ 将各位置的损失相加。xₜ 是第 t 个真实 token,x<ₜ 表示它之前的全部 token;pθ(xₜ ∣ x<ₜ) 是参数为 θ 的模型在给定前缀后,分配给真实下一个 token 的条件概率。log 是自然对数。因为概率在 0 到 1 之间,真实 token 的概率越小,log 值越负;最前面的负号把它变成越大的损失。反过来,模型给真实 token 的概率越高,该位置对总损失的贡献就越小。

训练时的因果遮罩是这一目标成立的关键。预测 xₜ 时,模型只能读取 x<ₜ,不能提前看到 xₜ 或它之后的 token,否则就会直接泄露答案。以“退款 已 批准。”为例,输入前缀“退款”时,自动目标是“已”;输入“退款 已”时,目标是“批准”;输入“退款 已 批准”时,目标是“。”。同一段原文因此连续产生多个前缀—目标对,数据中的每个可预测位置都贡献学习信号。

要在大量位置上降低 L_AR,模型必须利用前缀中能帮助预测后文的规律,包括语法、主题、词语共现、事实表达方式和代码结构。目标形式又与逐 token 生成完全一致,所以训练也自然形成了生成接口:给定已有前缀,模型反复预测下一个 token,再把它接到前缀后继续预测。

损失的含义有明确边界。它奖励的是模型生成与训练数据分布相似的后续内容,并不直接判断内容是否真实、无害,也不直接判断是否服从当前用户。较低的自回归损失说明模型更擅长预测数据中实际出现的 token;它不能单独证明模型的回答在其他标准上也是正确或合适的。

输入前缀自动目标
退款
退款 已批准
退款 已 批准
LAR=−Σt=2…T log pθ(xₜ|x<ₜ)

3遮盖重建用双向证据恢复缺失部分重建

遮盖重建先从原始样本中隐藏一部分内容,再要求模型根据剩余内容恢复被隐藏的部分。它把“原来被遮住的内容”直接变成自动目标,因此既不需要人工标签,又能迫使模型利用可见上下文中的结构。与只能读取前文的预测不同,文本遮盖通常可以同时使用缺失位置左侧和右侧的证据;图像遮盖则可以利用周围可见区域恢复缺失图像块。

损失可写为:

L_mask = −Σᵢ∈M log pθ(xᵢ ∣ x¬M)

L_mask 是所有被遮位置的总损失,M 是被遮位置的集合,i∈M 表示求和只覆盖这些位置。xᵢ 是位置 i 原本的真实内容,x¬M 表示移除 M 中内容后仍然可见的上下文。pθ(xᵢ ∣ x¬M) 是参数为 θ 的模型根据可见上下文给真实内容分配的恢复概率。对这个概率取负对数,意味着模型越不相信正确内容,受到的惩罚越大;模型越准确地恢复被遮内容,总损失越低。

在文本中,BERT 根据一个被遮 token 两边的文字来恢复它;在图像中,MAE 隐藏若干图像块,再根据可见图像块重建缺失区域。输入是经过遮盖的样本,输出是对被遮位置内容的预测,训练目标则直接取自遮盖前的原始样本。由此形成的因果链是:选择遮盖位置 → 删除可直接读取的答案 → 模型整合可见证据 → 预测缺失内容 → 用原内容计算损失。

遮盖率控制了任务的信息量与难度。遮盖过少时,缺失内容常能通过紧邻区域或局部规律轻易复制,模型可能依赖局部捷径,而不必形成更有迁移价值的表示;诊断到这种情况时,可以扩大遮盖块或增加可见证据与目标之间的距离。中等遮盖率通常能在“仍有足够证据可预测”和“任务没有简单到可走捷径”之间取得较好平衡,可通过下游迁移曲线判断这种平衡是否有效。遮盖过多时,可见证据不足,真实目标本身可能存在多种合理可能,损失便会被不可预测的细节主导;这时应把重建质量与语义探测结果分开观察。

“最佳遮盖率”不是固定常数,它取决于数据模态和模型。即使重建损失很低,也不能直接推断模型学到了理想语义。例如以像素为恢复目标时,模型可能把大量容量用于颜色和纹理等细节,而不是下游任务关心的语义结构。因此,遮盖设计不仅要让缺失内容可恢复,还要让恢复任务所需的证据与希望保留的信息相一致。

遮盖率主要风险诊断
局部捷径扩大遮盖块/距离
通常平衡迁移曲线
目标不确定重建质量与语义探测分开看
Lmask=−Σi∈M log pθ(xᵢ|x¬M)

4手算对比学习:把正对从负对中识别出来InfoNCE

对比学习把表示学习变成一个候选识别问题:给定锚点样本 A 的表示 a,模型要在一组候选中识别同一商品的增强视图 A⁺,同时把候选负样本 B、C 排到后面。输入是锚点、正视图和候选负样本的表示,输出是各候选与锚点匹配的概率;自动目标是“哪一个候选与锚点来自同一商品”。

单个锚点的损失为:

ℓ = −log [exp(sim(a, a⁺) ∕ τ) ∕ Σⱼ exp(sim(a, j) ∕ τ)]

a 是锚点 A 的表示,a⁺ 是正样本 A⁺ 的表示。j 遍历正样本和所有候选负样本,sim(a, j) 衡量两种表示的相似度。τ 是温度,用于缩放相似度差异;sim(a, j) ∕ τ 是进入指数和归一化之前的 logit。对每个 logit 取 exp,再除以所有候选指数值之和,就得到该候选的归一化概率。ℓ 取正样本概率的负对数,因此正样本概率越接近 1,损失越小;如果负样本获得较高分数,正样本概率就会被分母压低,损失随之上升。

沿用商品图 A、B、C,A⁺ 是 A 的裁剪视图。设 s(A,A⁺)=0.8、s(A,B)=0.3、s(A,C)=0.1,温度 τ=0.2。相似度除以温度后得到三个 logit:

[0.8 ∕ 0.2, 0.3 ∕ 0.2, 0.1 ∕ 0.2] = [4, 1.5, 0.5]

取指数后约为 [54.60, 4.48, 1.65],分母为 54.60 + 4.48 + 1.65 = 60.73。于是正样本概率为:

54.60 ∕ 60.73 ≈ 0.899

对应损失为:

−log 0.899 ≈ 0.106

这个结果说明,在当前三个候选中,模型已经把 A⁺ 排在 B、C 之前,而且优势明显。它描述的是这一候选集合内的相对识别能力,而不是对所有可能商品的绝对保证。

温度决定相似度差异被放大的程度。τ 较低时,同样的相似度差距会变成更大的 logit 差距,模型对排序错误受到更强惩罚;但如果正负关系标错,这种放大也会增强错误监督。候选集合本身同样改变任务:批量大小和负样本来源决定分母里有哪些竞争者,从而改变识别难度。尤其当某个“负样本”其实与锚点语义相近时,会出现 false negative,也就是训练规则要求模型推远本应接近的表示。因此,较低损失应结合温度、候选构成和配对质量解释,不能脱离这些条件单独比较。

ℓ=−log exp(sim(a,a⁺)/τ) / Σjexp(sim(a,j)/τ)

5原创图:预文本目标决定模型被迫保留什么机制图

同一份原始数据并不会天然对应唯一的“好表示”。自监督学习先用构造规则把原始数据改造成训练输入和自动目标,模型随后只会因完成这个目标而受到奖励。于是,目标要求预测什么、恢复什么或忽略什么,就决定了表示必须保留哪些信息;没有影响损失的信息,则没有同等强度的动力被编码。

图 1 从同一原始数据出发,分出自回归、遮盖和对比三条任务路径,最后形成表示。三条路径的区别不在原始样本,而在自动标签的生成方式。自回归任务要求根据已有内容预测后续内容,因此表示必须保留有助于后续预测的线索。遮盖任务要求从可见部分恢复缺失部分,因此表示会优先组织可用于重建的上下文证据。对比任务要求识别哪些视图应当接近、哪些候选应当区分,因此表示会保留有助于完成这种配对判断的信息,并弱化构造规则允许变化的部分。

这条因果链可以写成:

原始数据 → 构造规则 → 输入与自动目标 → 损失约束 → 表示中被保留或忽略的信息

因此,“自动标签”并不是中立的数据处理步骤。即使原始数据完全相同,只要改变构造方式,模型接收到的错误信号就会不同,参数更新的方向也会不同,最终形成的表示自然可能不同。训练损失较低,只能说明表示足以支持当前预文本目标;它不能单独说明表示保留了所有信息,也不能保证其中的信息正好符合下游用途。

选择预文本目标,本质上是在指定学习偏好:模型应当对哪些差异敏感,又应当把哪些差异视为无关。判断一种构造规则是否合适,不能只看自动目标是否容易生成,还要看完成该目标所必需的信息,是否与实际希望模型保留的信息一致。图 1 所强调的正是这一点:表示并非仅由数据决定,而是由数据与任务构造共同决定。

原始数据 z文本 / 图像 / 音频右移:预测下一个保留顺序与生成分布遮盖:恢复缺失块保留上下文可预测结构增强:识别同一对象忽略被声明为不变的变化参数 / 表示线性探测 · 微调 · 提示下游任务独立验收
图 1 “自动标签”并不中立:构造规则定义模型应预测、恢复或忽略的信息。

6增强策略实际定义了语义不变性捷径

在对比式自监督学习中,数据增强不只是增加样本数量,它还在定义模型应该对什么保持不变。把原始样本的两种增强视图指定为正样本对,相当于向模型声明:增强改变的因素不应改变样本的语义身份。模型为了拉近这两个视图的表示,会主动弱化这些变化。因此,增强规则就是一种关于“哪些差异无关”的训练假设。

随机裁剪商品图时,合理假设是局部视图仍属于同一对象。若两个裁剪都保留了商品主体,把它们作为正对可以训练模型忽略构图或可见范围的变化。但若某次裁剪只剩品牌背景、完全丢掉商品,正对关系仍要求背景视图接近商品视图,模型便会被迫把背景与商品身份等价。此时自动配对在来源上没有错——两张图确实来自同一原图——却在语义上成为错误正对。

不同增强隐含不同的不变性,也有各自的破坏风险。随机裁剪声明“局部视图仍是同一对象”,风险是裁掉语义主体;颜色抖动声明“颜色不决定身份”,但当颜色本身就是任务标签时,这个声明会删除必要信息;文本回译声明“改写保持语义”,可回译过程可能改变否定、实体或语气。类似地,医学图像旋转、数字翻转或音频变速,也可能改变原本要识别的标签,不能因为它们在技术上可执行就默认语义保持不变。

增强过弱也会产生相反问题。如果两个正视图几乎一样,模型可能仅凭颜色直方图、文件压缩痕迹或边框等低层线索识别配对,而无须学习希望获得的语义。这时损失可以迅速下降,但下降来自捷径,并不代表表示真正捕捉了对象身份。

增强设计因此需要处在两种失败之间:既要足够强,使模型不能依赖无关的表面捷径;又不能强到改变语义标签或移除关键主体。判断增强是否合适,应检查它声明的不变性是否符合任务,并观察增强后的正对是否仍在语义上成立。只有这两个条件同时满足,“拉近正对”才会把表示推向预期方向。

增强声明的不变性破坏风险
随机裁剪局部视图同对象裁掉语义主体
颜色抖动颜色不决定身份颜色是任务标签
文本回译改写保持语义否定、实体或语气变化

7无负样本方法用不对称结构防止坍缩自蒸馏

如果训练目标只要求同一样本的两种视图产生相同表示,那么把所有输入都映射成同一个常数向量,确实也能让一致性损失达到很低。这就是表示坍缩:正对彼此完全一致,但不同样本之间也无法区分,表示因而失去可用信息。问题不在“两种视图靠近”这一要求本身,而在于只有这一项约束时,目标没有要求表示保留跨样本变化。

无显式负样本的方法必须另外加入防坍缩机制。BYOL、DINO 等方法通过停止梯度、教师的动量更新、中心化或锐化、预测头等设计制造不对称,使两条分支不再以完全相同的方式同时追逐一个平凡解。

以 BYOL 的两条分支为例,在线分支根据一种增强视图产生预测,目标分支根据另一种增强视图产生训练目标。目标分支的输出停止梯度,不在同一步被预测误差直接更新;它的参数由在线分支参数的动量平均缓慢更新。在线分支中的预测头负责逼近这个相对稳定的目标。输入仍是同一样本的两种视图,输出仍要保持一致,但两条分支的角色和更新路径不同,不再是两个完全对称、同时变化的目标。

DINO 的学生—教师自蒸馏也让学生去匹配教师为另一视图产生的输出,并用教师动量更新维持目标分支。中心化和锐化进一步调节教师输出的分布,避免训练只靠无区分度的输出获得表面一致。停止梯度、动量教师、预测头、中心化和锐化不是所有方法都同时采用的统一配方;它们分别服务于具体方法中的不对称训练结构。

因此,“没有显式负样本”不等于“没有防坍缩机制”。判断训练是否健康,也不能只看一致性损失,因为常数表示在这一指标上可能表现很好。更直接的诊断包括表示方差、奇异值谱和最近邻多样性:方差反映各维度是否仍随样本变化;奇异值谱显示主要表示方向还剩多少变化强度;最近邻多样性则检查不同输入的邻居是否都退化为相似结果。这些指标需要与训练损失一起解释,才能区分真正的一致表示与平凡坍缩。

8迁移评测要区分冻结表示与端到端适配验收

自监督预训练得到的表示是否有用,必须通过迁移任务来检验;但不同评测协议测量的能力并不相同。线性探测表现差,只能说明冻结表示后,目标类别没有被一个简单线性层很好地分开,不能据此断言预训练完全失败。表示中可能仍包含可通过非线性适配或参数更新利用的信息。

线性探测冻结预训练模型,只训练线性分类器,主要测量表示是否已经线性可分。它便于隔离表示本身的结构,却可能低估需要微调才能显现的信息。全量微调允许预训练模型的全部参数随下游数据更新,主要测量这一初始化对下游任务的可适配性;但结果同时混入了下游模型容量、训练预算和优化设置,因此不能完全归因于预训练表示。

少样本或提示评测关注在很少标注数据或特定交互接口下的效果,主要反映数据效率与接口能力。它的结果往往方差较大,也可能对提示形式敏感。冻结检索不训练或少训练额外参数,直接依据表示之间的距离寻找相似样本,主要检查距离空间是否把相关对象放在邻近位置;结果同时依赖所选索引方式和相似度度量。

这些协议回答的是不同问题,因而不应把某一个分数当作表示质量的完整结论。冻结评测更强调预训练后立即可读出的结构,端到端适配更强调参数在下游监督下继续变化的潜力。若线性探测弱而全量微调强,合理解释是表示未必已经线性组织好,但初始化仍可适配;若冻结检索强,则说明距离空间可能已经具有可用结构。任何一种解释都应限定在相应协议内。

为了让比较有效,所有协议都必须固定数据划分和调参预算,避免把更多数据或更多试验机会误当成方法优势。总体分数之外,还应按数据来源、群体、难度以及分布外样本切片,检查平均结果是否掩盖局部失效。预训练损失只能监控自动目标是否被持续优化,它不能替代迁移证据:低预训练 loss 说明模型更会完成预文本任务,并不直接说明它在冻结、微调、少样本或检索协议下都能迁移。

协议主要测什么局限
线性探测表示是否线性可分低估可微调信息
全量微调初始化可适配性混入下游容量与预算
少样本/提示数据效率与接口能力方差大、提示敏感
冻结检索距离空间质量依赖索引与度量

9规模优势把瓶颈转移到数据治理边界

自监督学习可以从原始数据自动构造目标,因而减少人工逐条标注的需求,但这只改变了标签的生产方式,并没有让数据变成免费、合法或无风险的资源。训练仍依赖大规模原始数据,而这些数据的采集、保存、处理和使用都需要治理。

首先,能够访问某份数据不等于拥有训练授权。数据仍涉及许可、隐私和当事人同意,自动生成目标不会消除这些要求。其次,原始语料需要去重和污染检查:重复样本会改变数据分布;若评测集或其近似副本出现在预训练语料中,模型可能因为见过答案而表现良好,从而伪造迁移能力。此时评测分数反映的是泄漏,而不是对未见数据的泛化。

自动目标还会继承数据本身的问题。数据中的偏见、恶意内容和群体覆盖不均不会因“没有人工标签”而消失;相反,当模型持续从这些数据构造并优化大量目标时,这些模式也可能随训练信号一起被放大。训练目标来自数据,只能说明目标可自动获得,并不说明它符合产品价值,也不保证不同来源、群体或场景得到同等质量的表示。

规模扩大后,瓶颈因此从“谁来写标签”转向“哪些数据可以用、数据经过了什么处理、问题发生后能否定位和删除”。治理记录至少需要覆盖数据来源、获取或纳入时间、处理链以及删除能力。来源记录用于判断授权与覆盖;时间信息有助于识别训练数据与评测或应用时间的关系;处理链说明数据经历过去重、过滤或其他变换;删除能力则保证发现许可、隐私或内容问题后,可以定位相关数据并执行处置。

自监督的规模优势成立于自动目标能够批量生成,但规模越大,未经治理的问题也越可能被带入训练。因而“省标签”应理解为降低一种人工成本,而不是免除数据责任。模型效果必须与授权、隐私、污染、内容风险和覆盖情况共同评估,不能只用预训练数据量或训练损失替代这些证据。

11完整示例:同一商品对比目标的验收闭环端到端示例

训练损失约为 0.106,只说明在当时由 A⁺、B、C 组成的候选集合中,模型给正视图 A⁺ 分配了较高概率。要证明表示真的可用于商品匹配,还需要把训练目标追踪到未见商品上的检索表现,并排除模型依赖背景等捷径的可能。这个从数据拆分、训练监控、冻结检索到反事实检查的过程,构成商品匹配的验收闭环。

验收的输入包括按商品身份拆分的训练图,以及测试阶段的查询图;输出包括 top-k 商品检索结果、表示方差,以及按背景、拍摄角度和品类划分的切片指标。第一步必须先固定商品级拆分,保证同一商品的近重复图片不会同时落入训练集与测试集。否则,检索成功可能来自对同一商品图像的记忆,无法证明模型能迁移到从未见过的商品。

训练阶段用 A 与其增强视图 A⁺ 构造正对,并持续记录正负样本相似度和表示方差。相似度反映模型是否按目标拉近正对、区分候选;表示方差用于检查不同商品的表示是否仍保留变化。两者都只是过程证据:相似度排序正确并不保证模型依据的是商品主体,方差正常也不保证距离空间适合真实检索。

随后冻结编码器,在从未见过的商品上执行 top-k 检索。查询图经过编码器得到表示,系统按照表示距离返回最接近的 k 个商品候选。冻结编码器意味着测试阶段不再用商品标签改写表示,从而更直接地检查预训练形成的距离空间。总体 top-k 指标还要按背景、角度和品类切片,因为平均值可能掩盖模型只在特定摄影条件或商品类别上有效。

最后加入两组反事实对照。“换背景不换商品”保持商品主体不变,只改变背景;若表示追踪商品身份,查询仍应召回同一商品。“换商品不换背景”保持摄影棚背景相似,但替换商品主体;若模型关注主体,它不应仅因背景一致就把二者判为同一商品。这两个对照把商品身份与背景线索拆开,用于定位模型究竟利用了哪一种信息。

结果需要沿整条证据链解释。若平均 top-k 很高,但更换背景后同一商品无法召回,说明模型可能学会了摄影棚捷径,而不是稳定的商品身份。只有商品级拆分无泄漏、表示未坍缩、未见商品检索有效、各切片表现可接受,并且反事实对照支持主体追踪时,才有证据认为表示适用于当前商品匹配任务。这个结论不能自动外推到细粒度颜色、文字识别或新的拍摄域;任务关心的信息或数据分布变化后,必须重新定义增强,并复测相应切片。

12把因果链连起来综合

自监督学习从一个具体选择开始:使用什么原始数据,以及希望模型对哪些变化保持不变。原始数据决定模型能够观察到的内容,期望不变性决定哪些差异应被忽略、哪些信息必须保留。这个选择不是背景条件,而是后续训练目标与表示性质的起点。

接下来要把这种学习意图转化为可计算的自动目标。预测目标从已有内容构造后续内容作为答案;遮盖目标隐藏样本的一部分,再用原始内容作为恢复答案;视图目标对同一样本构造不同视图,并定义它们之间应当保持的关系。构造规则把原始样本变成输入与目标,也把“希望学到什么”变成损失可以评价的任务。

优化阶段降低的是代理损失,而不是下游价值本身。损失下降表示模型越来越会完成预测、恢复或视图匹配,但它可能依赖局部线索、背景或其他捷径。对于只要求视图一致的方法,还必须加入防坍缩机制,确保不同输入的表示没有退化成相同常数。训练监控因此既要观察目标损失,也要检查表示是否仍保留足够变化。

预训练完成后,需要通过冻结或微调把表示迁移到下游任务。冻结评测检查预训练表示中已经直接形成的结构,微调评测检查这一初始化在下游监督下的可适配性。二者回答的问题不同,结果必须在固定数据划分和预算的条件下解释。预训练损失不能替代这些迁移证据。

迁移总体指标仍可能掩盖捷径,因此还要在真实切片上验证。按来源、群体、难度、背景、角度、品类或分布变化拆分结果,可以定位模型在哪些条件下失效;反事实对照则通过只改变一个因素,检查模型的输出究竟跟随目标主体还是无关线索。只有当切片与对照支持预期机制时,才能把性能提升归因于希望获得的表示。

整条链路还受数据治理约束。数据来源与许可决定能否使用,污染检查防止评测内容泄漏到预训练中,目标审查判断自动任务是否与产品价值一致。若来源不清、评测被污染或代理目标错位,即使训练和迁移数字很好,也无法形成可信结论。

因而,可验证的实践链条是:

原始数据与期望不变性 → 预测、遮盖或视图目标 → 代理损失优化与防坍缩 → 冻结或微调迁移 → 真实切片与反事实排查 → 来源、污染和目标错位审计

链条中的每一步都为下一步提供条件,也可能引入新的失败原因。最终要验证的不是“损失是否下降”这一孤立事实,而是数据、目标、表示、迁移表现和治理证据能否共同支持预期用途。

资料来源与改编说明
访问日期:2026-07-22