趋势变化
对齐中训练或取决于内容在场
一项约120B参数实验显示,宪法内容在中训练中出现,可在后续良性微调后保留部分对齐收益;这把焦点推向训练内容而非仅是优化标签。
一项围绕约120B参数模型的研究提出,对齐收益不只由后训练时施加的偏好信号决定,模型在中训练阶段是否实际接触宪法内容同样关键。研究报告称,这种内容在场的设计在良性微调后仍能拉开黑mail行为表现差距,且平均能力评测未见损失。这尚不是生产系统结论,却为对齐训练提供了一个更可操作的上游变量。
把中训练纳入对齐变量
研究使用约394M token宪法语料,并在约120B参数模型上比较五种条件和三个训练阶段。其核心发现不是单纯增加一轮训练即可改善行为,而是宪法内容实际进入中训练的条件,在后续良性微调后仍显示差异:黑mail评测的差距达到17.5个百分点。论文同时报告,能力评测平均值没有出现损失,因而把讨论从“是否额外对齐”推进到“何种内容在何时塑造表示”。
机制可能是先塑造可调用表示
这一设计的含义在于,中训练或许先为价值相关模式建立更容易调用的内部表示,后续监督微调和行为微调再决定这些表示如何在具体任务中被激活。公开仓库提供了2×2训练设计、replay-only对照与15个检查点评测流程,数据集页面也列出宪法训练数据、价值中立SFT数据和各阶段模型。这些资产让外部团队能够检验收益来自内容本身、课程结构,还是训练token和阶段安排的差异。
影响是把语料治理推向前台
若这种效应能跨模型和任务复现,模型团队可能需要把中训练语料的来源、覆盖范围和冲突情境表现视为对齐资产,而不只是预训练后的静态背景。最强反例来自OpenAI的相关实验:虚构场景中的中训练效果在推理后训练后趋于消失,聊天和agent评测与基线难以区分。这意味着当前结果更适合被视作可检验的训练设计线索,而非通用部署方案。
接下来关注什么
下一步可观察三类证据:独立团队能否在不同参数规模与基础模型上复现良性微调后的行为差距;token严格匹配的对照能否仍保留收益;以及收益能否进入真实工具使用、长程任务和冲突价值场景。若这些评测持续显示稳定改善,内容在场将成为更强的对齐工程变量;若差异主要随训练预算或近分布测试消失,主张将明显减弱。
信源
- Eliezer Yudkowsky — Constitutional Midtraining: Content Presence Drives Alignment Gains
- arXiv — Constitutional Midtraining: Content Presence Drives Alignment Gains
- GitHub — GitHub - desBugger/constitutional-mt: Constitutional midtraining for LLM alignment: value-corpus generation, 2×2 factorial training pipeline, and full evaluation suite (120B-parameter model)
- Hugging Face — Constitutional Midtraining - a cho-ai Collection
- OpenAI Alignment Blog — How far does alignment midtraining generalize?