中文

最大因果熵逆强化学习入门

机器学习 2022-03-23 v1 人工智能

摘要

逆强化学习(IRL)算法推断一个奖励函数,用以解释专家在环境中行动所提供的演示。最大因果熵(MCE)IRL 是当前最流行的 IRL 表述,拥有众多扩展。在本教程中,我们给出 MCE IRL 的精简推导以及当代 MCE IRL 算法实现的关键结果。我们希望这既能作为该领域新手的入门资源,也能作为熟悉这些主题的人的简明参考。

关键词

引用

@article{arxiv.2203.11409,
  title  = {A Primer on Maximum Causal Entropy Inverse Reinforcement Learning},
  author = {Adam Gleave and Sam Toyer},
  journal= {arXiv preprint arXiv:2203.11409},
  year   = {2022}
}

备注

29 pages