最大因果熵逆强化学习入门
机器学习
2022-03-23 v1 人工智能
摘要
逆强化学习(IRL)算法推断一个奖励函数,用以解释专家在环境中行动所提供的演示。最大因果熵(MCE)IRL 是当前最流行的 IRL 表述,拥有众多扩展。在本教程中,我们给出 MCE IRL 的精简推导以及当代 MCE IRL 算法实现的关键结果。我们希望这既能作为该领域新手的入门资源,也能作为熟悉这些主题的人的简明参考。
引用
@article{arxiv.2203.11409,
title = {A Primer on Maximum Causal Entropy Inverse Reinforcement Learning},
author = {Adam Gleave and Sam Toyer},
journal= {arXiv preprint arXiv:2203.11409},
year = {2022}
}
备注
29 pages