基于元学习的奖励外推探索超越示范者性能
机器学习
2022-02-28 v9 人工智能
摘要
通过模仿学习(IL)算法外推超越示范者(BD)性能旨在从示范者学习并随后超越示范者。为此,一种代表性方法是利用逆强化学习(IRL)从示范中推断奖励函数,然后对所学奖励函数执行RL。然而,大多数现有奖励外推方法需要大量示范,难以应用于训练数据有限的任务。为解决此问题,一个简单的方案是进行数据增强以人为生成更多训练数据,这可能引发严重的归纳偏置和策略性能损失。本文中,我们提出一种新颖的基于元学习的奖励外推(MLRE)算法,可使用有限示范有效逼近真实奖励。更具体地,MLRE首先从具有丰富训练数据的一组任务中学习初始奖励函数,然后利用目标任务的数据对所学奖励函数进行微调。大量仿真结果表明,所提MLRE相较其他类似BDIL算法可实现显著的性能提升。
引用
@article{arxiv.2102.02454,
title = {Exploring Beyond-Demonstrator via Meta Learning-Based Reward Extrapolation},
author = {Mingqi Yuan and Mao-on Pun},
journal= {arXiv preprint arXiv:2102.02454},
year = {2022}
}
备注
6 pages, 4 figures