中文

DCRM:衡量偏好优化中响应对质量的启发式方法

计算与语言 2025-11-18 v1 人工智能 机器学习

摘要

近期研究尝试将偏好优化 (PO) 性能与底层偏好数据集关联起来。本文观察到,首选响应 y+y^+ 与被否定响应 yy^- 之间的差异会影响大语言模型 (LLM) 能学习的内容,这可能与期望学习到的差异不符。因此,我们利用距离和奖励间隙对这些差异进行量化,并将其组合得到 Distance Calibrated Reward Margin (DCRM),用于衡量 PO 中响应对的质量。直观地说,DCRM 鼓励最小的噪声差异和最大的期望差异。随后,我们对三类常用偏好数据集进行研究,这些数据集沿两个轴线进行分类:响应的来源和偏好标注函数。我们建立了更高 DCRM 与更佳学习结果之间的一般性相关性。灵感来源于此,我们提出一种 best-of-N2N^2 配对方法,筛选出 DCRM 最高的响应对。实验结果表明,在 various 设置下,我们的方法可产生训练数据集,在 AlpacaEval、MT-Bench 和 Arena-Hard 上的表现优于现有训练集。

关键词

引用

@article{arxiv.2506.14157,
  title  = {DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization},
  author = {Chengyu Huang and Tanya Goyal},
  journal= {arXiv preprint arXiv:2506.14157},
  year   = {2025}
}