中文

基于周期性智能体状态的POMDP Q学习

机器学习 2024-10-30 v3

摘要

部分可观测马尔可夫决策过程(POMDP)的标准方法是将其转换为完全观测的信念状态MDP。然而,信念状态取决于系统模型,在强化学习(RL)设置下因此不可行。一个广泛使用的替代方法是使用智能体状态,这是一种无模型的、可递归更新的观察历史函数。例如包括帧堆叠和循环神经网络。由于智能体状态是无模型的,因此用于将标准RL算法适应到POMDP。然而,标准RL算法如Q学习学习的是稳态政策。我们的主要论点通过示例表明,由于智能体状态不满足马尔可夫性质,非稳态基于智能体状态的政策可能优于稳态政策。为利用这一特征,我们提出了PASQL(周期性智能体状态Q学习),这是一种基于智能体状态Q学习的变体,学习周期政策。通过结合周期马尔可夫链和随机逼近的思想,我们严格建立了PASQL收敛于循环极限,并 characterize 收敛周期政策的近似误差。最后,我们 presented 一个数值实验来突出PASQL的关键特征,并展示学习周期政策优于稳态政策的好处。

关键词

引用

@article{arxiv.2407.06121,
  title  = {Periodic agent-state based Q-learning for POMDPs},
  author = {Amit Sinha and Matthieu Geist and Aditya Mahajan},
  journal= {arXiv preprint arXiv:2407.06121},
  year   = {2024}
}

备注

Accepted in the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)