用中性奖励函数解决对抗模仿学习中的奖励偏差问题
机器学习
2020-09-22 v1 机器人学
机器学习
摘要
生成式对抗模仿学习存在由算法中所用奖励函数的选择引起的根本性奖励偏差问题。不同类型的偏差也会影响不同类型的环境——广义上分为生存型环境和任务型环境。我们给出了一个理论说明,解释为何现有奖励函数在具有多个终止状态的任务型环境的模仿学习场景中会失效。我们还提出了一种新的GAIL奖励函数,在具有单终止和多终止状态的任务型环境中均优于现有GAIL方法,并有效克服了生存偏差与终止偏差。
引用
@article{arxiv.2009.09467,
title = {Addressing reward bias in Adversarial Imitation Learning with neutral reward functions},
author = {Rohit Jena and Siddharth Agrawal and Katia Sycara},
journal= {arXiv preprint arXiv:2009.09467},
year = {2020}
}