中文

基于专家状态序列的混合强化学习

机器学习 2019-03-12 v1 人工智能 机器学习

摘要

现有的模仿学习方法通常要求完整的演示数据(包括动作序列与状态序列)可用。本文考虑一种更现实且更困难的场景:强化学习智能体仅能获取专家的状态序列,而专家动作不可观测。我们提出一种新颖的基于张量的模型来推断专家状态序列中未观测到的动作。随后,智能体的策略通过一个结合强化学习与模仿学习的混合目标进行优化。我们在一个示例性领域和 Atari 游戏上评估了我们的混合方法。实证结果表明:(1) 智能体能够利用专家状态序列比纯强化学习基线学习得更快;(2) 我们的基于张量的动作推断模型在推断专家动作方面优于标准深度神经网络;(3) 混合策略优化目标对专家状态序列中的噪声具有鲁棒性。

关键词

引用

@article{arxiv.1903.04110,
  title  = {Hybrid Reinforcement Learning with Expert State Sequences},
  author = {Xiaoxiao Guo and Shiyu Chang and Mo Yu and Gerald Tesauro and Murray Campbell},
  journal= {arXiv preprint arXiv:1903.04110},
  year   = {2019}
}

备注

AAAI 2019; https://github.com/XiaoxiaoGuo/tensor4rl