POROver:使用过生成与偏好优化提高大型语言模型的安全性并减少过度拒绝
计算与语言
2025-06-17 v2
摘要
在大型语言模型中同时实现高安全性和高实用性一直成为近年来面临的关键挑战。模型常表现出不安全的行为,或采用过于谨慎的方式,导致对良性提示频繁拒绝,从而降低实用性。其背后主要原因在于模型的微调和对齐方式,特别是所使用数据的性质和范围。本文考察了使用高级教师模型(如 GPT-4o)进行过度生成微调数据——涵盖通用提示和有害提示——对安全性和实用性的影响。此外,我们提出了 POROver,这是一种针对高度安全但易产生过度拒绝的模型的对齐策略。POROver 采用偏好优化算法,并利用来自高级教师模型的完成结果,以减少过度拒绝,同时保持安全水平。我们的结果表明,针对通用提示进行过度生成可显著提升安全性,仅对实用性产生最小影响。具体而言,由于安全性的显著提升,安全性和实用性之间的 F1 分数从 74.4% 提升至 91.8%。此外,针对有害提示进行过度生成可提升实用性,从 11.1% 提升至 57.6%,同时保持安全性。最后,应用 POROver 可进一步提升实用性——从 57.6% 提升至 82.1%——而保持安全性水平基本不变。我们的数据和代码已在 https://github.com/batuhankmkaraman/POROver 上提供。
引用
@article{arxiv.2410.12999,
title = {POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization},
author = {Batuhan K. Karaman and Ishmam Zabir and Alon Benhaim and Vishrav Chaudhary and Mert R. Sabuncu and Xia Song},
journal= {arXiv preprint arXiv:2410.12999},
year = {2025}
}