中文

基于策略的POMDP可扩展强化学习算法

材料科学 2025-10-09 v1 化学物理

摘要

POMDP中belief state的连续性为学习最优策略带来了显著的计算挑战。本文考虑一种方法,通过将相应的POMDP模型近似转化为有限状态马尔可夫决策过程(MDP,称为Superstate MDP)来求解部分可观测强化学习(PORL)问题。我们首先推导理论保证,改进了先前工作,揭示原始POMDP的最优值函数与转换后的Superstate MDP的最优值函数之间的关系。随后,我们提出一种基于策略的学习方法,采用线性函数逼近来学习Superstate MDP的最优策略。因此,我们的方法表明,POMDP可通过将其视为MDP来近似求解,其中MDP状态对应于有限历史。我们展示了近似误差随历史长度呈指数衰减。迄今为止,我们的有限时界限是首次明确量化了在真实动力学非马尔可夫ian情况下,将标准TD学习应用于该设置所引入的误差。

关键词

引用

@article{arxiv.2510.06539,
  title  = {Real-Space Quantification of Exciton Localization in Acene Crystals Using Wannier Function Decomposition},
  author = {Zui Tao and Jonah B. Haber and Jeffrey B. Neaton},
  journal= {arXiv preprint arXiv:2510.06539},
  year   = {2025}
}