向 DAA 桥接奖励-生成鸿沟
计算与语言
2026-04-17 v3 机器学习
摘要
直接对齐算法(DAAs),如直接偏好优化(DPO)和简单偏好优化(SimPO),已成为高效替代方案,用于将大型语言模型(LLM)与人类偏好相匹配。然而,DAAs 存在根本性局限,我们在此识别为“奖励-生成鸿沟”,即训练目标与自回归解码动力学之间的差异。本文认为,一个导致奖励-生成鸿沟的贡献者是前缀标记在 LLM 生成过程中在重要性方面的内在差异,以及这种重要性在 DAAs 的隐式奖励函数中的反映方式之间的不匹配。为弥合这一鸿沟,我们采用 DAAs 的标记级马尔可夫决策过程(MDP)视角进行分析,并引入一种简单而有效的方法,称为前缀导向等长训练(Prefix-Oriented Equal-length Training,POET),该方法将首选和不首选响应截断至匹配较短者的长度。我们针对 DPO 和 SimPO 两种代表性 DAAs 进行实验,表明 POET 在其标准实现版本中均取得显著改进,在 AlpacaEval 2 中提升最高可达 11.8 分,并在下游任务中实现整体性提升。这些结果凸显了通过更好地将训练目标与自回归解码动力学对齐,以减轻 DAAs 中的奖励-生成鸿沟的必要性。
引用
@article{arxiv.2506.09457,
title = {Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms},
author = {Zeguan Xiao and Yun Chen and Guanhua Chen and Ke Tang},
journal= {arXiv preprint arXiv:2506.09457},
year = {2026}
}
备注
Findings of ACL 2026