中文

面向战略证明的强化学习从人类反馈

机器学习 2025-10-17 v2

摘要

我们研究了在多位标注者可能策略性误报反馈以引导所学习策略朝向自身偏好方面的情形下的强化学习从人类反馈 (RLHF)。我们证明,现有的 RLHF 算法,包括最近的多元方法,都不具备战略防护性,且即使只有一位策略性标注者,也会导致与社会福利的误差可任意大。此外,我们证明,在最坏情况下,任何具备战略防护性的 RLHF 算法都比最优策略差 kk 倍,其中 kk 为标注者数量。这表明激励对齐 (确保标注者诚实报告) 与策略对齐 (最大化社会福利) 之间存在根本性权衡。为此,我们提出悲观 MLEs 中位数算法 (Pessimistic Median of MLEs),该算法在适当的策略覆盖假设下,近似具备战略防护性,并随标注者数量和样本数的增加而收敛至最优策略。我们的结果适用于情境式臂带和马尔可夫决策过程。

关键词

引用

@article{arxiv.2503.09561,
  title  = {Strategyproof Reinforcement Learning from Human Feedback},
  author = {Thomas Kleine Buening and Jiarui Gan and Debmalya Mandal and Marta Kwiatkowska},
  journal= {arXiv preprint arXiv:2503.09561},
  year   = {2025}
}

备注

To appear at NeurIPS 2025