BSO:安全对齐即密度比匹配
机器学习
2026-05-13 v1 人工智能
摘要
为实现语言模型在有用性和安全性上的对齐,通常需要复杂的管道——包括独立的奖励和成本模型、在线强化学习以及 primal-dual 更新。最近的直接偏好优化方法简化了训练,但通过人为修改(如多阶段程序或启发式边际项)引入安全性,缺乏原则性推导。我们表明,最优安全策略的似然比可分解为闭式形式,使安全对齐问题归结为密度比匹配问题。最小化Bregman散度可得Bregman安全优化(BSO),这是一族由凸生成器诱导的单阶段损失函数,能够必然恢复最优安全策略。BSO通用且简单:它无需额外模型,仅引入标准偏好优化之外的一个超参数,能恢复现有安全感知方法的特例。在多个安全对齐基准测试中,实验表明BSO在安全-有用性权衡上持续实现性能提升。
关键词
引用
@article{arxiv.2605.12339,
title = {BSO: Safety Alignment Is Density Ratio Matching},
author = {Tien-Phat Nguyen and Truong Nguyen and Thin Nguyen and Duy Minh Ho Nguyen and Ngoc-Thanh Dinh and Trung Le},
journal= {arXiv preprint arXiv:2605.12339},
year = {2026}
}