STARC:一种量化奖励函数差异的通用框架
机器学习
2024-12-13 v3 人工智能
摘要
为了使用强化学习解决任务,有必要首先将该任务的目标形式化为奖励函数。然而,对于许多现实世界任务,很难手动指定一个从不激励不良行为的奖励函数。因此,使用奖励学习算法(试图从数据中学习奖励函数)正日益流行。然而,奖励学习的理论基础尚不完善。特别是,通常不知道给定的奖励学习算法是否以高概率学习到可安全优化的奖励函数。这意味着奖励学习算法通常必须进行经验评估,这代价高昂,并且其失效模式难以提前预测。推导更好理论保证的障碍之一是缺乏量化奖励函数之间差异的良好方法。在本文中,我们提供了该问题的解决方案,形式为所有奖励函数空间上的一类伪度量,我们称之为 STARC(标准化奖励比较,STAndardised Reward Comparison)度量。我们证明 STARC 度量对最坏情况后悔(regret)同时给出了上界和下界,这意味着我们的度量是紧的,并且任何具有同样性质的度量必须与我们的度量双利普希茨等价。此外,我们还指出了早期工作提出的奖励度量中的若干问题。最后,我们对我们的度量进行了经验评估,以证明其实际有效性。STARC 度量可用于使奖励学习算法的理论分析和经验分析都更容易且更具原则性。
引用
@article{arxiv.2309.15257,
title = {STARC: A General Framework For Quantifying Differences Between Reward Functions},
author = {Joar Skalse and Lucy Farnik and Sumeet Ramesh Motwani and Erik Jenner and Adam Gleave and Alessandro Abate},
journal= {arXiv preprint arXiv:2309.15257},
year = {2024}
}