宪法式 AI:用显式原则指导批评、修订与偏好学习
从原则文本、情境解释、冲突优先级到 AI 反馈训练,理解怎样减少逐例人工标签,以及为什么原则选择仍然是治理问题。
1为什么把原则写出来直觉
逐个标注所有可能提示不可扩展时,怎样让监督覆盖新组合?
人类偏好标签往往只告诉某两个回答谁更好,背后的理由隐含在标注者心里。宪法把“不要捏造证据”“尊重用户自主但不得越权执行”等标准显式化,使模型能在未逐例标注的新输入上引用原则批评候选。显式化还允许审查、版本控制和争议定位。
2两个训练阶段怎样连接机制
模型先自我修订,再由 AI 生成偏好数据,各自解决什么?
监督阶段给模型有风险提示、初始回答和相关原则,让它写出具体批评并生成修订回答;这些修订可形成 SFT 数据。偏好阶段对多个回答按原则比较,由 AI 产生偏好标签,再训练奖励模型、DPO 或其他偏好目标。人工负责选择原则、抽查解释、处理冲突与校准 AI 反馈。
3原则必须能落到行为判断规格
“做一个好助手”为什么不是足够的宪法条款?
| 原则写法 | 问题 | 可判定改写 |
|---|---|---|
| 永远帮助用户 | 与安全、权限和真实性冲突 | 在不越权且有证据时提供最小充分帮助 |
| 不要伤害 | 范围和因果过于模糊 | 不得执行或指导明确的高风险不可逆动作;可提供安全替代 |
| 保持真实 | 不知道时怎样做未定义 | 事实结论需证据;不足时标注未知或请求核验 |
| 保护隐私 | 何种数据、谁的权限不清 | 只在当前主体授权范围内读取和披露必要字段 |
每条原则应附适用条件、正反例、优先级或冲突流程、允许的例外和验证方法。否则模型只能依赖自身语感解释抽象词,AI 反馈会把不稳定解释规模化。
4一次退款回答怎样被批评和修订运行示例
用户要求“直接保证全额退款,不要核对订单”时,帮助、真实和权限原则怎样共同作用?
| 候选 | 真实性 0–2 | 权限 0–2 | 帮助性 0–2 | 硬约束 | 选择 |
|---|---|---|---|---|---|
| A 保证退款 | 0 | 0 | 1 | 失败 | 淘汰 |
| B 只说“不能帮” | 2 | 2 | 0 | 通过 | 不优选 |
| C 说明未知并给核验路径 | 2 | 2 | 2 | 通过 | 优选 |
不能把三项简单相加后允许 A 用“帮助性高分”抵消越权:真实性和权限是硬约束,先过滤;帮助性只在可行集合 B/C 内排序。这个词典序决策比一个总分更能表达不可交易边界。
5原则冲突怎样处理治理
帮助性与无害性、隐私与审计、普遍规则与文化语境冲突时怎么办?
先区分硬约束、可权衡目标和风格偏好;为常见冲突声明优先级与升级路径;允许模型列出适用原则和不确定解释,而不是强行制造唯一答案。高影响价值冲突应交给具备授权的人,而非让基础模型为自己的解释投票。
| 冲突 | 处理方式 | 需保留证据 |
|---|---|---|
| 帮助 vs 越权 | 不执行,提供授权内替代 | 主体、动作、资源权限 |
| 隐私 vs 安全审计 | 最小披露与受权审计通道 | 目的、字段、保留期 |
| 原则文本歧义 | 请求澄清或升级 | 冲突条款与候选解释 |
| 规则随政策更新 | 版本化、回归与生效日期 | 原则版本和训练数据版本 |
6AI 反馈为什么会放大同源偏差失败边界
用模型批评模型,为什么规模变大却不一定监督更独立?
批评器、偏好标注器和策略若来自相近模型,可能共享事实盲点、语言偏好和文化假设。AI 会稳定偏爱更像自己生成风格的回答,或机械匹配原则关键词。需要人工校准集、不同评审器、专家高风险切片、反事实提示和隐藏红队测试;分歧应被保存,不要用多数票抹平。
7怎样评测原则真的起作用评测
原则遵循率升高时,如何避免帮助性下降被平均数掩盖?
分别报告有害请求违规、无害请求过度拒绝、事实错误、可执行帮助、原则引用正确、冲突一致性和群体差异。构造最小对照:只改变风险条件、授权主体或事实证据,检查行为是否随原则适用性变化,而不是对所有敏感词一律拒绝。
例如 100 个无害边界案例中,旧模型正确帮助 82、过拒 18;新模型帮助 68、过拒 32,即使有害集违规从 12 降到 4,也不能只报告“安全提高 8 点”。应画帮助—安全前沿并按风险代价选阈值。
8原则如何版本化和审计工程
原则更新后,怎样知道哪些数据、模型和行为仍由旧版本产生?
每条原则有稳定 id、版本、负责人、理由、适用范围、生效日期、示例和退役规则;批评记录引用具体 id;训练数据、奖励模型和策略记录所用宪法集合。变更先跑冲突与回归集,再灰度上线。不能只修改提示文本而保留无法追踪的旧偏好数据。
用户或审核者应能看到与决定相关的简洁原则和证据,但不必暴露冗长内部推理;重点是可质疑、可申诉和可回滚。
9常见误区与学习路线误区与路线
显式原则提高可审计性,不把价值选择变成纯技术问题。
| 常见误解 | 更准确的理解 |
|---|---|
| 宪法能自动代表所有人的价值 | 原则选择、优先级和例外仍需合法治理 |
| 写了原则就能保证遵守 | 训练只改变倾向,权限与高风险边界需外部强制 |
| AI 反馈比人工完全客观 | 它可扩展但会放大基础模型同源偏差 |
| 原则越多覆盖越完整 | 更多条款增加冲突、检索和解释复杂度 |
| 少拒绝就是更有帮助 | 需同时测合适帮助、适当拒绝与风险违规 |
| 层级 | 概念依赖与延伸 |
|---|---|
| 先修 | 监督微调、偏好学习、RLHF、对齐 |
| 本页核心 | 显式原则、批评修订、AI 偏好、冲突优先级与版本治理 |
| 紧邻 | 奖励投机、人在回路、安全护栏、提示注入 |
| 工程延伸 | 模型评测、治理、偏见公平、红队与权限管理 |
10把因果链连起来综合
这个概念怎样从问题一路连接到可验证的实践?
- 选择并版本化原则
- 生成初始回答
- 检索适用条款并批评
- 按冲突规则最小修订
- 形成 AI/人类偏好数据
- 独立评测帮助性与安全回归
11误区与自测自测
你能否不用背术语,解释它的机制、边界与验证方法?
- 宪法式 AI 为什么能减少逐例人工标签?
- 为什么原则分数不能总是相加?
- AI 反馈主要同源风险?
- 宪法能代替权限系统吗?
- 更新原则需同步哪些制品?
- 假设“宪法式 AI:用显式原则指导批评、修订与偏好学习”在离线示例上表现正常、上线后核心结果却下降,你会怎样按输入、内部变换、输出反馈和适用边界定位问题?
参考答案
- 显式原则可指导模型为新组合生成批评、修订和偏好信号。
- 权限等硬约束不可由风格或帮助性分数抵消。
- 批评器与策略可能共享事实、风格和文化盲点。
- 不能,工具与高风险动作须由模型外强制授权。
- 原则版本、批评记录、训练数据、奖励/偏好模型、策略和回归集。
- 先保存同一失败样本及环境,确认输入、权限和前置条件没有漂移;再记录关键中间状态,检查机制是否按本页描述完成变换;随后把原始输出与独立指标、人工终验对照;最后用边界样例和对照实验复测。只有定位到首次偏离预期的环节,才能判断应修改数据、机制、评测还是使用边界。
- Constitutional AI: Harmlessness from AI Feedback:批评修订与 AI 反馈框架
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback:帮助性/无害性偏好训练
- Direct Preference Optimization:偏好优化目标
- Collective Constitutional AI:公众输入与原则治理探索