语言模型中奖励正例与惩罚负例的梯度分析框架
计算与语言
2024-08-30 v1 机器学习
机器学习
摘要
除了最大似然估计(MLE)——即优化正例概率的语言模型(LM)的标准目标外,许多研究还探索了同时惩罚负例以提升输出分布质量的方法,包括非似然训练、指数最大化平均处理效应和直接偏好优化(DPO)。为了系统地比较这些方法并进一步为 LM 优化提供统一方案,本文从梯度分析的独特视角研究了在 LM 中同时奖励正例和惩罚负例的损失函数。通过数学推导以及在 CausalDialogue 和 Anthropic HH-RLHF 数据集上的实验,我们识别出这些方法之间显著的功能特征差异。我们发现 ExMATE 可作为 MLE 的优越替代方案,并且将 DPO 与 ExMATE 而非 MLE 结合使用,可进一步提升统计性能(5-7%)和生成性能(胜率 +18%)。
引用
@article{arxiv.2408.16751,
title = {A Gradient Analysis Framework for Rewarding Good and Penalizing Bad Examples in Language Models},
author = {Yi-Lin Tuan and William Yang Wang},
journal= {arXiv preprint arXiv:2408.16751},
year = {2024}
}