中文

偏好优化的对齐方式是 LLM 安全的关键

机器学习 2024-09-13 v1

摘要

我们展示了偏好优化方法能够有效提升 LLM 安全性。通过将多种对齐技术应用于 Falcon 11B 模型,并运用安全数据集,我们实现了全方位安全评分的显著提升(从 57.64%提升至 99.90%),评估指标为 LlamaGuard 3 8B,性能与最新模型相当。在毒性基准测试中,对抗性场景下的平均得分从超过 0.6 降至不足 0.07。然而,这一安全提升以牺牲通用能力为代价,尤其是在数学领域,呈现出权衡关系。我们识别出噪声对比对齐(Safe-NCA)作为平衡安全性与性能的最优方法。我们的研究最终表明,对齐技术足以构建安全且鲁棒的模型。

关键词

引用

@article{arxiv.2409.07772,
  title  = {Alignment with Preference Optimization Is All You Need for LLM Safety},
  author = {Reda Alami and Ali Khalifa Almansoori and Ahmed Alzubaidi and Mohamed El Amine Seddik and Mugariya Farooq and Hakim Hacid},
  journal= {arXiv preprint arXiv:2409.07772},
  year   = {2024}
}