中文

面向已知观测模型的平均奖励 POMDPs 实现 $\widetilde{\mathcal{O}}(\sqrt{T})$ 损失

机器学习 2025-09-09 v2 机器学习

摘要

我们解决平均奖励无限时程部分可观测马尔可夫决策过程 (POMDP) 的问题,其中转移模型未知但观测模型已知。该设置以两种限制性方式被处理:(i) 依赖次优随机策略的频率方法,这些策略为每个动作分配最小概率;(ii) 采用最优策略类的贝叶斯方法,但需对估计器一致性作出强假设。我们的工作消除了这些限制,证明了对转移模型的便利估计保证,并引入一种乐观算法,利用基于确定性信念策略的最优策略类。我们对现有估计技术进行修改,为每个估计的动作转移矩阵分别提供理论保证。与无法利用不同策略样本的现有估计方法不同,我们提出一种新型且简单的数据高效估计器,以克服这一障碍。这种新型数据高效技术结合我们提出的 \emph{按动作 OAS-UCRL} 算法和更紧的理论分析,导致首次实现对最优策略的 O(TlogT)\mathcal{O}(\sqrt{T \log T}) 损失保证,从而超越现有技术。最后,通过数值仿真验证了本方法在基线方法中的有效性。

关键词

引用

@article{arxiv.2501.18790,
  title  = {Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models},
  author = {Alessio Russo and Alberto Maria Metelli and Marcello Restelli},
  journal= {arXiv preprint arXiv:2501.18790},
  year   = {2025}
}