中文

面向复杂部分观测的判别粒子滤波强化学习

机器学习 2020-02-25 v1 人工智能 机器学习

摘要

深度强化学习在 Atari、Go 等复杂博弈的决策中取得了成功。然而,现实世界的决策往往需要从复杂视觉观测中提取的部分信息进行推理。本文提出判别粒子滤波强化学习(DPFRL),一种面向复杂部分观测的新强化学习框架。DPFRL 在神经网络策略中编码一个可微分的粒子滤波器,用于对随时间变化的部分观测进行显式推理。该粒子滤波器使用学习的判别更新来维持信念,并针对决策进行端到端训练。我们表明,使用判别更新而非标准生成模型可显著提升性能,尤其在具有复杂视觉观测的任务中,因为它们规避了建模与决策无关的复杂观测的困难。此外,为从粒子信念中提取特征,我们基于矩生成函数提出了一种新型信念特征。DPFRL 在现有 POMDP RL 基准 Flickering Atari Games 以及本文引入的更具挑战性的新 POMDP RL 基准 Natural Flickering Atari Games 中均优于最先进的 POMDP RL 模型。进一步,DPFRL 在 Habitat 环境中使用真实世界数据进行视觉导航时表现良好。

关键词

引用

@article{arxiv.2002.09884,
  title  = {Discriminative Particle Filter Reinforcement Learning for Complex Partial Observations},
  author = {Xiao Ma and Peter Karkus and David Hsu and Wee Sun Lee and Nan Ye},
  journal= {arXiv preprint arXiv:2002.09884},
  year   = {2020}
}

备注

Accepted to ICLR 2020