因子化 POMDP 中的贝叶斯强化学习
人工智能
2018-11-15 v1
摘要
贝叶斯方法为强化学习中的探索-利用权衡提供了原则性解决方案。然而,典型方法要么假设完全可观测环境,要么可扩展性差。本文引入因子化贝叶斯自适应 POMDP 模型,该框架能够在部分可观测系统中学习动力学的同时利用底层结构。我们还提出了一种信念跟踪方法来近似状态和模型变量上的联合后验,以及对蒙特卡洛树搜索求解方法的改编,二者结合能够近最优地求解底层问题。我们的方法能够在给定已知因子化结构时高效学习,也可同时学习因子化结构和模型参数。我们证明了该方法能够超越当前方法并解决先前不可行的问题。
引用
@article{arxiv.1811.05612,
title = {Bayesian Reinforcement Learning in Factored POMDPs},
author = {Sammie Katt and Frans Oliehoek and Christopher Amato},
journal= {arXiv preprint arXiv:1811.05612},
year = {2018}
}