风险敏感生成对抗模仿学习
机器学习
2018-12-27 v2 人工智能
机器学习
摘要
我们研究风险敏感模仿学习,其中智能体的目标是在风险轮廓意义上表现得至少与专家一样好。我们首先表述我们的风险敏感模仿学习设定。我们考虑模仿学习的生成对抗方法(GAIL),并推导出我们表述的一个优化问题,称之为风险敏感GAIL(RS-GAIL)。随后我们推导出RS-GAIL优化问题的两个不同版本,旨在就Jensen-Shannon(JS)散度和Wasserstein距离匹配智能体与专家的风险轮廓,并基于这些优化问题开发了风险敏感生成对抗模仿学习算法。我们在两个MuJoCo和两个OpenAI经典控制任务中评估了我们的算法性能,并与GAIL及风险规避模仿学习(RAIL)算法进行比较。
引用
@article{arxiv.1808.04468,
title = {Risk-Sensitive Generative Adversarial Imitation Learning},
author = {Jonathan Lacotte and Mohammad Ghavamzadeh and Yinlam Chow and Marco Pavone},
journal= {arXiv preprint arXiv:1808.04468},
year = {2018}
}