中文

具有后见多观测的POMDP的样本高效学习

机器学习 2023-07-07 v1 机器学习

摘要

本文研究部分可观测马尔可夫决策过程(POMDPs)学习的样本效率,这是强化学习中一个具有挑战性的问题,已知在最坏情况下具有指数级难度。受游戏载入等现实场景启发,我们提出一种增强反馈模型称为“后见多观测”,即在每次与POMDP交互的回合后,学习者可收集从所遇隐状态发出的多个额外观测,但无法观测隐状态本身。我们表明在此反馈模型下,两个新POMDP子类的样本高效学习是可能的:\emph{多观测揭示POMDP}与\emph{可区分POMDP}。两个子类均推广并实质性放宽了\emph{揭示POMDP}——一类在标准轨迹反馈下可实现样本高效学习的被广泛研究的子类。值得注意的是,可区分POMDP仅要求来自不同隐状态的发射分布\emph{不同},而非如揭示POMDP中所要求的\emph{线性无关}。

关键词

引用

@article{arxiv.2307.02884,
  title  = {Sample-Efficient Learning of POMDPs with Multiple Observations In Hindsight},
  author = {Jiacheng Guo and Minshuo Chen and Huan Wang and Caiming Xiong and Mengdi Wang and Yu Bai},
  journal= {arXiv preprint arXiv:2307.02884},
  year   = {2023}
}