中文

用于逆强化学习的广义最大因果熵

机器学习 2020-08-19 v2 机器学习

摘要

我们考虑利用逆强化学习(IRL)从演示轨迹中学习的问题。受经典最大熵模型在捕捉状态网络结构方面的局限性启发,我们提出了一种基于广义因果熵最大化问题的 IRL 模型,该问题使我们能够生成一类最大熵 IRL 模型。我们的广义模型除奖励函数外,还能恢复另一个专家函数,该函数可(部分)捕捉状态连接结构对专家决策的影响,这是其优势所在。在真实世界数据集和网格世界数据集上的实证评估表明,在恢复奖励函数和演示轨迹方面,我们的广义模型优于经典模型。

关键词

引用

@article{arxiv.1911.06928,
  title  = {Generalized Maximum Causal Entropy for Inverse Reinforcement Learning},
  author = {Tien Mai and Kennard Chan and Patrick Jaillet},
  journal= {arXiv preprint arXiv:1911.06928},
  year   = {2020}
}