模型规格中期训练:提高对齐训练的泛化方式
人工智能
2026-05-25 v2
摘要
一些前沿 AI 开发者致力于将语言模型对齐到描述其预期行为的模型规格或宪法。然而,标准的对齐微调——即针对规格对齐行为的演示进行训练——可能产生浅层对齐,泛化效果不佳,部分原因是演示数据未能充分定义所需的泛化。我们引入模型规格中期训练(MSM):在预训练之后、对齐微调之前,对模型进行训练,使用合成文档讨论其模型规格。这教会模型学习规格内容,从而塑造其从后续演示数据中进行泛化的方式。例如,仅针对表达 certain 奶酪偏好(例如,"我更喜欢奶油奶酪而非芝士")进行微调的模型,在应用以该规格为基础的 MSM 时,会泛化到广泛的亲美国价值观。相反,针对亲可负性价值观的规格则会从相同的奶酪微调中产生亲可负性的泛化。MSM 还能塑造复杂的安全相关倾向:应用针对自我保存和目标保护的规格进行 MSM,可显著降低代理化误对齐率(通义千问 32B:从 54% 降至 7%),超越一种审慎对齐基线(14%)。我们进一步利用 MSM 作为研究哪些模型规格能产生最强对齐泛化的工具,发现解释规则背后价值观的规格有助于改善泛化,提供具体而非笼统的指导也同样有效。总体而言,MSM 是一种简单而有效的技术,通过首先教会模型其预期的泛化方式,从而控制并提高模型从对齐训练中进行的泛化。
引用
@article{arxiv.2605.02087,
title = {Model Spec Midtraining: Improving How Alignment Training Generalizes},
author = {Chloe Li and Nevan Wichers and Sara Price and Samuel Marks and Jon Kutasov},
journal= {arXiv preprint arXiv:2605.02087},
year = {2026}
}