中文

POMDP中用于模仿学习的信念表示学习

机器学习 2019-06-25 v1 机器学习

摘要

我们考虑在部分可观测马尔可夫决策过程(POMDP)中从专家示范进行模仿学习的问题。信念表示刻画了POMDP中潜在状态上的分布,已使用循环神经网络和概率潜变量模型建模,并被证明对POMDP中的强化学习有效。在本工作中,我们研究POMDP中生成对抗模仿学习的信念表示学习问题。与先前工作建议的分别训练信念模块和策略不同,我们使用任务感知的模仿损失将信念模块与策略联合学习,以确保表示更契合策略的目标。为提高表示的鲁棒性,我们引入了若干信息化的信念正则化技术,包括动力学与动作序列的多步预测。在各种部分可观测连续控制运动任务上评估,我们的信念模块模仿学习方法(BMIL)大幅优于若干基线,包括原始GAIL算法与任务无关信念学习算法。广泛的消融分析表明了任务感知信念学习与信念正则化的有效性。

关键词

引用

@article{arxiv.1906.09510,
  title  = {Learning Belief Representations for Imitation Learning in POMDPs},
  author = {Tanmay Gangwani and Joel Lehman and Qiang Liu and Jian Peng},
  journal= {arXiv preprint arXiv:1906.09510},
  year   = {2019}
}

备注

Conference on Uncertainty in Artificial Intelligence (UAI 2019)