面向安全对齐的课程学习
机器学习
2026-05-27 v1 人工智能
摘要
直接偏好优化(Direct Preference Optimisation, DPO)在大型语言模型的安全对齐中广泛使用。然而,先前的工作表明其脆弱性差异较大,表现出较差的超分布(out-of-distribution, OOD)泛化。在本文中,我们研究课程学习(Curriculum Learning)是否能提高基于DPO的安全对齐鲁棒性。我们提出Staged-Competence(分阶段能力),一种基于课程的框架,将偏好数据按难度组织,采用基于能力的抽样方法,并在训练期间逐步更新参考模型。在三个模型家族中平均测试,Staged-Competence将OOD有害响应率降低16%,降级攻击成功率降低20%,同时保持通用能力,近乎零拒绝。我们进一步表明,Staged-Competence(1)仅使用75%的训练数据即可匹配基线安全性,(2)在安全与不安全响应之间获得更好的分离。Staged-Competence对策略优化损失具有中立性,可扩展至其他DPO变体和对齐领域。我们的代码和数据已公开于https://github.com/Sandeep5500/curriculum-learning-for-safety。
引用
@article{arxiv.2605.26315,
title = {Curriculum Learning for Safety Alignment},
author = {Sandeep Kumar and Virginia Smith and Chhavi Yadav},
journal= {arXiv preprint arXiv:2605.26315},
year = {2026}
}
备注
Accepted at the ICML 2026 GlobalSouthML Workshop