习得奖励函数的动力学感知比较
机器学习
2022-01-26 v1 人工智能
摘要
习得奖励函数的能力在使智能体部署于真实世界中起着重要作用。然而,比较奖励函数(例如作为评估奖励学习方法的一种手段)存在挑战。奖励函数通常通过考虑优化策略的行为来比较,但该方法将奖励函数的缺陷与用于优化它的策略搜索算法的缺陷混为一谈。为应对此挑战,Gleave等人(2020)提出等价策略不变比较(EPIC)距离。EPIC避免了策略优化,但这样做需要在系统动力学下可能不可达的转移处计算奖励值。这对习得奖励函数而言是有问题的,因为它需要在训练分布外评估它们,导致不准确的奖励值,我们表明这可使EPIC在比较奖励时失效。为解决该问题,我们提出动力学感知奖励距离(DARD),一种新的奖励伪度量。DARD使用环境的大致转移模型将奖励函数转换为一种形式,允许进行对奖励塑形不变的比较,同时仅在接近其训练分布的转移上评估奖励函数。在模拟物理域中的实验表明,DARD无需策略优化即可实现可靠奖励比较,且在处理习得奖励函数时比基线方法显著更能预测下游策略性能。
引用
@article{arxiv.2201.10081,
title = {Dynamics-Aware Comparison of Learned Reward Functions},
author = {Blake Wulfe and Ashwin Balakrishna and Logan Ellis and Jean Mercat and Rowan McAllister and Adrien Gaidon},
journal= {arXiv preprint arXiv:2201.10081},
year = {2022}
}