无界空间 MDP 的量化器设计:模型近似、模型学习与量化 Q 学习
最优化与控制
2025-10-15 v2 机器学习
摘要
在本文中,针对具有无界状态空间的马尔可夫决策过程 (MDP),我们提出了对 [Kara 等人 JMLR'23] 中给出的有限模型近似误差上限的细化上限,并考虑了量化器设计对量化 Q 学习和经验模型学习的影响,以及将量化状态被当作实际状态进行的策略的性能。我们强调了规划与学习(无论是通过 Q 学习还是经验模型学习)之间的区别:在规划中,MDP 的近似可以独立设计;而在学习中,MDP 的近似受限于在探索策略下马尔可夫链不变测度意义下定义,导致量化器设计性能上存在显著细微之处,尽管在两种设置下都可以建立渐近近最优性。特别是在 Lyapunov 增长条件下,我们获得了显式的上限,这些上限随着 bin 数量的增加而趋于零。
引用
@article{arxiv.2510.04355,
title = {Quantizer Design for Finite Model Approximations, Model Learning, and Quantized Q-Learning for MDPs with Unbounded Spaces},
author = {Osman Bicer and Ali D. Kara and Serdar Yuksel},
journal= {arXiv preprint arXiv:2510.04355},
year = {2025}
}