中文

从响应而非偏好中学习:基于非平行数据进行 LLM 去毒的 Stackelberg 方法

计算与语言 2024-10-29 v1 人工智能

摘要

文本去毒是风格迁移任务的一种变体,在在线社交媒体中具有实用价值。本文提出一种仅使用非平行数据的微调方法,将大型语言模型(LLM)转化为去毒重写器。我们将微调过程建模为 LLM(领导者)与毒性筛查器(跟随者)之间的 Stackelberg 博弈,其中毒性筛查器是一个二分类风格分类器(有毒或无毒)。LLM 旨在根据筛查器调整其偏好,并生成通过筛查的改写文本。非平行数据微调的主要挑战在于偏好不完整。在改写失败的情况下,分类器无法在输入和改写文本之间建立偏好,因为它们属于同一种有毒风格。因此,诸如直接偏好优化(DPO)等偏好对齐微调方法不再适用。为了应对偏好不完整的挑战,我们提出了基于 DPO 改进而来的 Stackelberg 响应优化(SRO),使 LLM 能够从跟随者的响应中学习。其核心要旨在于:如果改写文本未能通过跟随者的筛查,SRO 会降低生成该改写文本的概率;而当改写文本通过筛查时,则对有毒输入及其改写文本对执行 DPO。实验表明,经过 SRO 微调的 LLM 在风格准确率、内容相似度和流畅度方面取得了与 SOTA 模型相当的令人满意的性能。其整体去毒性能超越了其他计算方法,并达到了人类参考水平。额外的经验证据表明,SRO 对筛查器的反馈很敏感,轻微的扰动会导致性能显著下降。我们在 \url{https://github.com/XXXinhong/Detoxification_LLM} 发布了代码和 LLM 模型。

关键词

引用

@article{arxiv.2410.20298,
  title  = {Learning from Response not Preference: A Stackelberg Approach for LLM Detoxification using Non-parallel Data},
  author = {Xinhong Xie and Tao Li and Quanyan Zhu},
  journal= {arXiv preprint arXiv:2410.20298},
  year   = {2024}
}