偏好噪声对生成式语言模型对齐性能的影响
计算与语言
2024-04-16 v1
摘要
开发生成式语言模型(GLM)的一个关键要求是使其价值观与人类价值观对齐。基于偏好的对齐是用于此目的的广泛使用的范式,其中首先从人类标注者或 AI 系统中获取生成对的偏好,然后将其输入到某些对齐技术中,例如 Direct Preference Optimization。然而,用于 GLM 对齐的偏好对中有很大比例(20 - 40%)是带噪的,目前尚不清楚噪声如何影响对齐性能以及如何减轻其负面影响。在本文中,我们提出了一个框架,向偏好中注入所需数量和类型的噪声,并系统地研究了偏好噪声在两个任务(摘要和对话生成)中对对齐性能的影响。我们发现对齐性能对偏好数据中的噪声率高度敏感:例如,噪声率增加 10 个百分点会导致对齐性能(胜率)下降 30 个百分点。为了减轻噪声的影响,当存在某些类型的噪声时,基于置信度的数据过滤显示出显著益处。我们希望我们的工作能帮助社区更好地理解和减轻 GLM 对齐中偏好噪声的影响。
引用
@article{arxiv.2404.09824,
title = {Impact of Preference Noise on the Alignment Performance of Generative Language Models},
author = {Yang Gao and Dana Alon and Donald Metzler},
journal= {arXiv preprint arXiv:2404.09824},
year = {2024}
}