中文

致力于改进RL奖励设计:面向RL实践者的奖励对齐度量

机器学习 2025-07-28 v2 人工智能

摘要

强化学习代理受限于其学习奖励函数的质量,但奖励设计常被忽视,仿佛一个明确定义的奖励函数随手可得。然而实际中,奖励设计往往困难重重,即便如此,评估其正确性同样面临挑战:我们如何判断奖励函数是否被正确指定?本文聚焦于奖励对齐——评估奖励函数是否准确编码了人类利益相关者的偏好。作为奖励对齐的具体度量,我们引入轨迹对齐系数(Trajectory Alignment Coefficient),以量化人类利益相关者对轨迹分布排序与给定奖励函数诱导的排序之间的相似性。我们展示了轨迹对齐系数具有理想属性,包括无需接触真实奖励、对基于潜在奖励调整的奖励变换不变,且适用于在线RL。此外,在对11名RL实践者进行的用户研究中,我们发现,若在奖励选择期间提供轨迹对齐系数,可实现统计显著的改进。相较于仅依赖奖励函数,本度量将认知负荷降低1.5倍,82%的用户偏好它,并将产生高效策略的奖励函数选择成功率提高41%。

关键词

引用

@article{arxiv.2503.05996,
  title  = {Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners},
  author = {Calarina Muslimani and Kerrick Johnstonbaugh and Suyog Chandramouli and Serena Booth and W. Bradley Knox and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:2503.05996},
  year   = {2025}
}