等化 RLHF:大语言模型中提高有用性-安全性权衡的路径
人工智能
2025-02-18 v1
摘要
基于人类偏好对大型语言模型进行微调(通常通过强化学习从人类反馈实现)是提高模型性能的有效方法。然而,在微调过程中维持 LLM 的安全性仍是一个重大挑战,因为解决安全性与有用性之间的冲突并非易事。通常情况下,LLM 的安全对齐是在与安全相关类别数据上进行训练的。然而,我们的实验发现,单纯增加安全训练数据的规模通常会导致 LLM 进入“过于安全”状态而非“真正安全”状态,通过大量安全对齐数据来提升拒绝率,却未能真正理解安全响应的要求。这种方法可能无意中削弱模型的有用性。为理解这一现象,本文首先通过将安全数据分为三组来探讨安全数据在训练中的作用,并观察到每组数据在规模扩大时表现出不同行为。为提升安全性与有用性之间的平衡,本文提出了等化 RLHF 框架,包括细粒度数据中心(Fine-grained Data-centric, FDC)方法,能够在更少的训练数据下实现更好的安全对齐;以及自适应分段对齐(Adaptive Message-wise Alignment, AMA)方法,通过梯度遮蔽策略有针对性地突出显示关键片段。大量实验结果表明,我们的方法显著提升了 LLM 的安全对齐水平,同时实现了安全性与有用性的平衡。
引用
@article{arxiv.2502.11555,
title = {Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models},
author = {Yingshui Tan and Yilei Jiang and Yanshi Li and Jiaheng Liu and Xingyuan Bu and Wenbo Su and Xiangyu Yue and Xiaoyong Zhu and Bo Zheng},
journal= {arXiv preprint arXiv:2502.11555},
year = {2025}
}