中文

随机逆强化学习

机器学习 2022-09-26 v8 人工智能 机器学习

摘要

逆强化学习(IRL)问题的目标是从专家示范中恢复奖励函数。然而,如同任何不适定逆问题,IRL问题患有先天缺陷:策略可能对许多奖励函数都是最优的,而专家示范也可能对许多策略是最优的。在这项工作中,我们将IRL问题推广为一个适定的期望优化问题——随机逆强化学习(SIRL),以恢复奖励函数上的概率分布。我们采用蒙特卡洛期望最大化(MCEM)方法来估计概率分布的参数,作为SIRL问题的首个解。该解简洁、鲁棒且可迁移于学习任务,并能生成IRL问题的替代解。通过我们的公式,可以从全局视角观察IRL问题的内在属性,并且我们的方法在objectworld上取得了相当的性能。

关键词

引用

@article{arxiv.1905.08513,
  title  = {Stochastic Inverse Reinforcement Learning},
  author = {Ce Ju},
  journal= {arXiv preprint arXiv:1905.08513},
  year   = {2022}
}

备注

8+2 pages, 5 figures, Under Review