中文

面向 RLHF 的通用探索奖励

机器学习 2026-02-18 v4 人工智能 计算与语言

摘要

乐观探索是提高强化学习与人类反馈(RLHF)样本效率的关键,但现有的探索奖励方法往往未能实现乐观。我们提供了理论分析,表明当前的公式在 KL 或 α\alpha-divergence 正则化下,会不经故意地偏向参考模型的高概率区域,从而强化保守行为,而非促进发现不确定区域。为此,我们提出通用探索奖励(GEB),一个能够实现乐观原则的新型理论框架。GEB 通过参考依赖的奖励调节来抵消 divergence 引入的偏差,并将先前的启发式奖励作为特殊情况统一起来,同时自然地扩展到完整的 α\alpha-divergence 系列。实验结果表明,GEB 在多个 divergence 设置和大型语言模型 backbone 上均优于基准方法。这些结果表明,GEB 提供了一种既原则又实用的 RLHF 乐观探索解决方案。

关键词

引用

@article{arxiv.2510.03269,
  title  = {General Exploratory Bonus for Optimistic Exploration in RLHF},
  author = {Wendi Li and Changdae Oh and Sharon Li},
  journal= {arXiv preprint arXiv:2510.03269},
  year   = {2026}
}

备注

ICLR 2026