不完美奖励模型是否可以更高效?基于策略覆盖性的视角
机器学习
2025-05-20 v3 人工智能
机器学习
摘要
样本效率是在线强化学习从人类反馈(RLHF)中的关键因素。虽然已有研究探索了样本高效的在线探索策略,但如何利用不完美但相关的奖励模型加速学习仍鲜有探索。本文研究如何在在线RLHF中从这些不完美奖励模型中转移知识。我们通过识别KL正则化在RLHF目标函数下的一种新属性:策略对最优策略的可覆盖性由其次优解决定。基于这一洞见,我们提出了新的迁移学习原则和一种具有可证明优势的理论算法——Transfer Policy Optimization (TPO)。在实验方面,受理论发现启发,我们开发了基于胜率的迁移策略选择策略,以提高计算效率。此外,我们的经验迁移学习技术是模块化的,可以集成到各种策略优化方法中,如DPO、IPO和XPO,以进一步提升其性能。我们通过摘要任务上的实验验证了该方法的有效性。
引用
@article{arxiv.2502.19255,
title = {Can RLHF be More Efficient with Imperfect Reward Models? A Policy Coverage Perspective},
author = {Jiawei Huang and Bingcong Li and Christoph Dann and Niao He},
journal= {arXiv preprint arXiv:2502.19255},
year = {2025}
}
备注
36 Pages; ICML 2025