中文

用于语言模型对齐的基于最小贝叶斯风险目标的正则化Best-of-N采样

计算与语言 2025-01-30 v4 人工智能

摘要

在解码时,使用奖励模型的 Best-of-N (BoN) 采样已被证明是将大型语言模型(LLM)与人类偏好对齐的有效策略。当由于偏好数据集的质量或数量导致奖励模型的准确度不够高时,BoN 采样容易出现一种被称为奖励作弊的问题。因为奖励模型是真实目标的不完美代理,过度优化其价值可能会损害其在真实目标上的性能。在本研究中,我们提出了 MBR-BoN,一种 BoN 的变体,旨在通过将最小贝叶斯风险(MBR)目标作为邻近正则化项纳入,在推理时缓解奖励作弊。我们从经验上和分析上表明,MBR 目标量化了响应与参考策略的邻近度,充当邻近正则化器。我们在 AlpacaFarm 和 Anthropic 的 hh-rlhf 数据集上评估了 MBR-BoN,并表明它优于 BoN 采样和 MBR 解码。我们还评估了使用 MBR-BoN 生成用于直接偏好优化(DPO)的成对偏好学习数据集。经验结果表明,使用 MBR-BoN 生成的数据集训练的模型优于使用原始 BoN 的模型。我们的代码可在 https://github.com/CyberAgentAILab/regularized-bon 获取。

关键词

引用

@article{arxiv.2404.01054,
  title  = {Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment},
  author = {Yuu Jinnai and Tetsuro Morimura and Kaito Ariu and Kenshi Abe},
  journal= {arXiv preprint arXiv:2404.01054},
  year   = {2025}
}

备注

NAACL 2025