中文

RAIL:风险规避模仿学习

机器学习 2017-11-30 v4 人工智能

摘要

当奖励信号不可用时,模仿学习算法通过模仿专家的行为来学习可行策略。生成对抗模仿学习(GAIL)是一种在专家行为以固定轨迹集合形式提供时学习策略的先进算法。我们根据专家的代价函数进行评估,并观察到在多个基准连续控制任务中,GAIL 智能体的轨迹代价分布通常比专家具有更重的尾部。因此,与专家相比,GAIL 智能体更有可能遇到对应于灾难性失败尾部事件的高代价轨迹。这使得 GAIL 智能体在部署于机器人手术和自动驾驶等风险敏感应用时的可靠性受到质疑。在本工作中,我们旨在通过在 GAIL 框架内最小化尾部风险来减少尾部事件的发生。我们用轨迹的条件风险价值(CVaR)来量化尾部风险,并开发了风险规避模仿学习(RAIL)算法。我们观察到,用 RAIL 学习的策略比原始 GAIL 表现出更低的尾部风险。因此,所提出的 RAIL 算法作为 GAIL 的有力替代方案,可在风险敏感应用中提高可靠性。

关键词

引用

@article{arxiv.1707.06658,
  title  = {RAIL: Risk-Averse Imitation Learning},
  author = {Anirban Santara and Abhishek Naik and Balaraman Ravindran and Dipankar Das and Dheevatsa Mudigere and Sasikanth Avancha and Bharat Kaul},
  journal= {arXiv preprint arXiv:1707.06658},
  year   = {2017}
}

备注

Accepted for presentation in Deep Reinforcement Learning Symposium at NIPS 2017