面向 RLHF 的通用探索奖励
机器学习
2026-02-18 v4 人工智能
计算与语言
摘要
乐观探索是提高强化学习与人类反馈(RLHF)样本效率的关键,但现有的探索奖励方法往往未能实现乐观。我们提供了理论分析,表明当前的公式在 KL 或 -divergence 正则化下,会不经故意地偏向参考模型的高概率区域,从而强化保守行为,而非促进发现不确定区域。为此,我们提出通用探索奖励(GEB),一个能够实现乐观原则的新型理论框架。GEB 通过参考依赖的奖励调节来抵消 divergence 引入的偏差,并将先前的启发式奖励作为特殊情况统一起来,同时自然地扩展到完整的 -divergence 系列。实验结果表明,GEB 在多个 divergence 设置和大型语言模型 backbone 上均优于基准方法。这些结果表明,GEB 提供了一种既原则又实用的 RLHF 乐观探索解决方案。
引用
@article{arxiv.2510.03269,
title = {General Exploratory Bonus for Optimistic Exploration in RLHF},
author = {Wendi Li and Changdae Oh and Sharon Li},
journal= {arXiv preprint arXiv:2510.03269},
year = {2026}
}
备注
ICLR 2026