具有后见多观测的POMDP的样本高效学习
机器学习
2023-07-07 v1 机器学习
摘要
本文研究部分可观测马尔可夫决策过程(POMDPs)学习的样本效率,这是强化学习中一个具有挑战性的问题,已知在最坏情况下具有指数级难度。受游戏载入等现实场景启发,我们提出一种增强反馈模型称为“后见多观测”,即在每次与POMDP交互的回合后,学习者可收集从所遇隐状态发出的多个额外观测,但无法观测隐状态本身。我们表明在此反馈模型下,两个新POMDP子类的样本高效学习是可能的:\emph{多观测揭示POMDP}与\emph{可区分POMDP}。两个子类均推广并实质性放宽了\emph{揭示POMDP}——一类在标准轨迹反馈下可实现样本高效学习的被广泛研究的子类。值得注意的是,可区分POMDP仅要求来自不同隐状态的发射分布\emph{不同},而非如揭示POMDP中所要求的\emph{线性无关}。
引用
@article{arxiv.2307.02884,
title = {Sample-Efficient Learning of POMDPs with Multiple Observations In Hindsight},
author = {Jiacheng Guo and Minshuo Chen and Huan Wang and Caiming Xiong and Mengdi Wang and Yu Bai},
journal= {arXiv preprint arXiv:2307.02884},
year = {2023}
}