中文

风险敏感生成对抗模仿学习

机器学习 2018-12-27 v2 人工智能 机器学习

摘要

我们研究风险敏感模仿学习,其中智能体的目标是在风险轮廓意义上表现得至少与专家一样好。我们首先表述我们的风险敏感模仿学习设定。我们考虑模仿学习的生成对抗方法(GAIL),并推导出我们表述的一个优化问题,称之为风险敏感GAIL(RS-GAIL)。随后我们推导出RS-GAIL优化问题的两个不同版本,旨在就Jensen-Shannon(JS)散度和Wasserstein距离匹配智能体与专家的风险轮廓,并基于这些优化问题开发了风险敏感生成对抗模仿学习算法。我们在两个MuJoCo和两个OpenAI经典控制任务中评估了我们的算法性能,并与GAIL及风险规避模仿学习(RAIL)算法进行比较。

关键词

引用

@article{arxiv.1808.04468,
  title  = {Risk-Sensitive Generative Adversarial Imitation Learning},
  author = {Jonathan Lacotte and Mohammad Ghavamzadeh and Yinlam Chow and Marco Pavone},
  journal= {arXiv preprint arXiv:1808.04468},
  year   = {2018}
}