基于策略的一致性训练在最小能力退化情况下提升大语言模型安全性
机器学习
2026-05-22 v1
摘要
对齐后的模型可能以多种方式出现问题:它们往往是拘谨的,容易受到越狱攻击,或未能包含适当的安全警告。一致性训练是一种有前景的对齐范式,通过使用对比输入对来将训练不变量嵌入模型中,以缓解此类故障。现有的一致性训练程序一次性生成监督信号,并使用监督微调(SFT)来更新模型。不幸的是, resulting models tend to merely memorize the surface forms of the training distribution and thus generalize poorly and regress in their capabilities. 我们引入了基于策略的一致性训练(OPCT),这是一种新的一致性训练方法,其目标是在模型对提示的自身响应上计算,由其在相应对比提示下的条件响应来监督。我们在三个安全轴上评估了 OPCT:拘谨性、越狱和安全意识。对于三个模型系列,OPCT 在所有安全需求方面都优于其 SFT 对手。在基准测试中,OPCT 将拘谨率几乎减半(8.1% vs. 15.4%,与 SFT 的 11.2% 比较)。在具有适应性的 per-target 攻击者下,OPCT 在 held-out 越狱行为上保持约 99% 的防御成功率,而 SFT 平均为 87%。在安全意识方面,OPCT 在两个模型中优于 SFT,并在第三个模型中持平。OPCT 还大大避免了 SFT 引起的能力退化,如在 MATH-500 上的 28 分下降。我们的结果表明,一致性训练最好实现为 OPCT 而不是 SFT,特别是在希望在训练分布之外实现一般化时。
引用
@article{arxiv.2605.21834,
title = {On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation},
author = {Andy Han and Kristina Fujimoto and Avidan Shah and Kiet Nguyen and Kai Xu and Chen Yueh-Han and Ilia Sucholutsky and Rico Angell},
journal= {arXiv preprint arXiv:2605.21834},
year = {2026}
}