论习得奖励函数的脆弱性
机器学习
2023-01-11 v1 人工智能
摘要
奖励函数众所周知难以指定,尤其是对于具有复杂目标的任务。奖励学习方法试图从人类反馈与偏好中推断奖励函数。先前关于奖励学习的工作主要关注与奖励函数一同训练的策略的性能。然而,这种做法可能无法检测出那些不能从零开始训练新策略、从而未捕捉预期行为的习得奖励。我们的工作聚焦于展示并研究基于偏好的奖励学习领域中这些再学习失败的原因。我们在表格与连续控制环境中通过实验证明,再学习失败的严重程度可能对奖励模型设计和轨迹数据集组成的变化敏感。基于我们的发现,我们强调文献中需要更多基于重训练的评价。
引用
@article{arxiv.2301.03652,
title = {On The Fragility of Learned Reward Functions},
author = {Lev McKinney and Yawen Duan and David Krueger and Adam Gleave},
journal= {arXiv preprint arXiv:2301.03652},
year = {2023}
}
备注
5 pages, 2 figures, presented at the NeurIPS Deep RL and ML Safety Workshops