中文

基于多个偏好预言机的离线约束 RLHF

机器学习 2026-04-02 v1

摘要

我们研究基于多个偏好预言机的离线约束人类反馈强化学习(RLHF)。受性能与安全性或公平性之间权衡的应用驱动,我们旨在最大化目标总体效用,同时满足最小组保护福利约束。我们从参考策略下收集的成对比较中,通过最大似然估计预言机特定奖励,并分析统计不确定性如何通过对偶程序传播。我们将约束目标表述为以 Gibbs 策略为原始优化器的 KL 正则化拉格朗日函数,从而将学习简化为凸对偶问题。我们提出一种仅依赖对偶变量的算法,确保高概率约束满足,并为离线约束偏好学习提供首批有限样本性能保证。最后,我们将理论分析扩展以适应多个约束和一般 f-散度正则化。

关键词

引用

@article{arxiv.2604.00200,
  title  = {Offline Constrained RLHF with Multiple Preference Oracles},
  author = {Brenden Latham and Mehrdad Moharrami},
  journal= {arXiv preprint arXiv:2604.00200},
  year   = {2026}
}