正则化智能体状态基于 Q 学习在 POMDP 中的收敛性分析
机器学习
2025-09-04 v2
摘要
本文提出了一种框架,用于理解在实际应用中常见的 Q 学习强化学习算法的收敛性。此类算法具有两个显著特征:(i) Q 表通过智能体状态(例如循环神经网络的状态)递归更新,该状态既不是信念状态也不是信息状态;(ii) 通常会使用策略正则化来鼓励探索并稳定学习算法。我们研究最简单形式的此类 Q 学习算法,称为正则化智能体状态基于 Q 学习 (RASQL),并在温和技术条件下证明其收敛于 appropriately 定义的正则化 MDP 的固定点,该固定点取决于行为策略诱导的平稳分布。我们还表明,对学习周期性策略的 RASQL 的类似分析仍然适用。我们给出数值示例,以说明经验收敛行为与提出的理论极限相吻合。
引用
@article{arxiv.2508.21314,
title = {Convergence of regularized agent-state-based Q-learning in POMDPs},
author = {Amit Sinha and Matthieu Geist and Aditya Mahajan},
journal= {arXiv preprint arXiv:2508.21314},
year = {2025}
}
备注
Accepted in CDC 2025