基于周期性智能体状态的POMDP Q学习
机器学习
2024-10-30 v3
摘要
部分可观测马尔可夫决策过程(POMDP)的标准方法是将其转换为完全观测的信念状态MDP。然而,信念状态取决于系统模型,在强化学习(RL)设置下因此不可行。一个广泛使用的替代方法是使用智能体状态,这是一种无模型的、可递归更新的观察历史函数。例如包括帧堆叠和循环神经网络。由于智能体状态是无模型的,因此用于将标准RL算法适应到POMDP。然而,标准RL算法如Q学习学习的是稳态政策。我们的主要论点通过示例表明,由于智能体状态不满足马尔可夫性质,非稳态基于智能体状态的政策可能优于稳态政策。为利用这一特征,我们提出了PASQL(周期性智能体状态Q学习),这是一种基于智能体状态Q学习的变体,学习周期政策。通过结合周期马尔可夫链和随机逼近的思想,我们严格建立了PASQL收敛于循环极限,并 characterize 收敛周期政策的近似误差。最后,我们 presented 一个数值实验来突出PASQL的关键特征,并展示学习周期政策优于稳态政策的好处。
关键词
引用
@article{arxiv.2407.06121,
title = {Periodic agent-state based Q-learning for POMDPs},
author = {Amit Sinha and Matthieu Geist and Aditya Mahajan},
journal= {arXiv preprint arXiv:2407.06121},
year = {2024}
}
备注
Accepted in the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)