中文

基于半参数与非参数方法的风险敏感逆强化学习

人工智能 2018-03-23 v2 机器学习 机器人学

摘要

逆强化学习(IRL)的文献通常假设人类采取行动是为了最小化代价函数的期望值,即人类是风险中性的。然而在实践中,人类往往远非风险中性。为弥补这一差距,本文的目标是设计一种风险敏感 IRL 框架,以显式地考虑人类的风险敏感性。为此,我们提出了一类基于相干风险度量的灵活模型,其能够捕捉从风险中性到最坏情形的一整类风险偏好谱。我们提出了基于线性规划的高效非参数算法,以及基于最大似然的半参数算法,用于推断人类在丰富的静态与动态决策场景下的潜在风险度量和代价函数。所得方法在一个有十名人类参与者参与的模拟驾驶游戏中得到验证。我们的方法能够以数据高效的方式推断并模仿从高度风险厌恶到风险中性的多种定性不同的驾驶风格。此外,将风险敏感(RS)IRL 方法与风险中性模型进行比较表明,RS-IRL 框架在定性与定量上都能更准确地捕捉观察到的参与者行为,尤其是在可能发生碰撞等灾难性结果的场景中。

关键词

引用

@article{arxiv.1711.10055,
  title  = {Risk-sensitive Inverse Reinforcement Learning via Semi- and Non-Parametric Methods},
  author = {Sumeet Singh and Jonathan Lacotte and Anirudha Majumdar and Marco Pavone},
  journal= {arXiv preprint arXiv:1711.10055},
  year   = {2018}
}

备注

Submitted to International Journal of Robotics Research; Revision 1: (i) Clarified minor technical points; (ii) Revised proof for Theorem 3 to hold under weaker assumptions; (iii) Added additional figures and expanded discussions to improve readability