对抗性DPO:利用有害数据减少毒性,同时最小化对对话智能体连贯性和回避性的影响
计算与语言
2024-05-22 v1 人工智能
摘要
开放域对话系统的最新进展得益于高质量大型语言模型(LLM)和各种有效训练方法的出现。然而,这些模型中存在的毒性带来了重大挑战,可能降低用户体验。在本研究中,我们引入了一种创新的训练算法,是对直接偏好优化(DPO)的改进,称为对抗性DPO(ADPO)。ADPO算法旨在训练模型为偏好响应分配更高的概率分布,而为不安全响应分配更低的概率分布,这些不安全响应是使用毒性控制令牌自生成的。我们证明ADPO增强了模型对有害对话的鲁棒性,同时最小化性能下降。此外,我们说明ADPO相比传统DPO提供了更稳定的训练过程。据我们所知,这是首次将DPO算法直接适应于将有害数据纳入生成模型,从而减少人工创建安全对话数据的需求。
引用
@article{arxiv.2405.12900,
title = {Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents},
author = {San Kim and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2405.12900},
year = {2024}
}
备注
15 pages, 7 figures, accepted to NAACL findings 2024