基于显式奖励的语言模型噪声对比对齐
机器学习
2024-10-31 v3 计算与语言
摘要
用户意图通常被形式化为在微调语言模型(LM)时要最大化的评估奖励。现有的对齐方法,如直接偏好优化(DPO),主要针对成对偏好数据设计,其中奖励是隐式定义而非显式给出的。在本文中,我们引入了一个用于LM对齐的通用框架,利用噪声对比估计(NCE)来弥合处理显式标注有标量评估的奖励数据集时的差距。我们的框架包含两个并行算法,NCA和InfoNCA,两者都支持直接从奖励数据以及偏好数据中提取LM策略。值得注意的是,我们证明了DPO损失是我们提出的InfoNCA目标在成对偏好设置下的一个特例,从而整合并扩展了当前的对齐理论。通过比较NCA和InfoNCA,我们证明了DPO/InfoNCA中观察到的似然下降趋势是由它们专注于调整不同响应之间的相对似然引起的。相比之下,NCA优化每个响应的绝对似然,从而有效防止所选响应的似然下降。我们在奖励和偏好设置下使用Mistral-8*7B和7B模型评估了我们的方法。实验表明,当奖励数据集可用时,InfoNCA/NCA优于各种偏好基线。我们还发现NCA在数学和编码等复杂推理任务中显著优于DPO。
引用
@article{arxiv.2402.05369,
title = {Noise Contrastive Alignment of Language Models with Explicit Rewards},
author = {Huayu Chen and Guande He and Lifan Yuan and Ganqu Cui and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:2402.05369},
year = {2024}
}
备注
NeurIPS 2024