中文

离线偏好型强化学习的设计考量

机器学习 2025-02-12 v1 人工智能

摘要

使用仅基于固定人类偏好反馈数据集的离线强化学习算法(RLHF),该数据集包含给定输入的若干响应样本以及这些响应之间的偏好反馈,在语言模型对齐文献中受到越来越多的关注。本文从理论视角研究了诸如 DPO、IPO、SLiC 及其众多变体等方法的不同设计选择如何影响所学策略的质量。我们的处理为损失函数、用于归一化对数似然的策略以及数据抽样策略的选择提供了见解。值得注意的是,我们的结果不依赖于动机一些该系列方法算法的标准重参数化式论证,这使我们能够对广泛的方法类给出统一的处理。我们还进行了小规模的经验研究,以验证理论发现,在标准摘要基准测试上。

关键词

引用

@article{arxiv.2502.06861,
  title  = {Design Considerations in Offline Preference-based RL},
  author = {Alekh Agarwal and Christoph Dann and Teodor V. Marinov},
  journal= {arXiv preprint arXiv:2502.06861},
  year   = {2025}
}