中文

部分可观测性下可证明的分布式价值迭代

人工智能 2026-05-07 v3

摘要

在许多实际的规划任务中,智能体必须处理关于环境状态的不确定性以及由随机动力学和奖励引起的结果变异性。针对近期在世界模型方法中所见成果,即潜在模型对近似信念进行建模并支持规划,我们将分布式强化学习(DistRL)——该方法针对完全可观测域建模整个回报分布——扩展到部分可观测马尔可夫决策过程(POMDP)。具体而言,我们引入了部分可观测性的新型分布式 Bellman 算子,并在 supremum p- Wasserstein 度量下证明了其收敛性。我们还提出了通过 psi 向量表示这些回报分布的有限表示,该表示概括了经典 POMDP 求解器中的 alpha 向量。基于此,我们开发了分布式点基值迭代(DPBVI),将 psi 向量集成到标准的点基备份过程中,将 DistRL 与 POMDP 规划相结合。我们的实验表明,DPBVI 在无风险中性情况下恢复了经典的点基值迭代(PBVI),验证了分布式扩展的有效性。

关键词

引用

@article{arxiv.2505.06518,
  title  = {Provable Distributional Value Iteration under Partial Observability},
  author = {Larry Preuett and Qiuyi Zhang and Muhammad Aurangzeb Ahmad},
  journal= {arXiv preprint arXiv:2505.06518},
  year   = {2026}
}

备注

Accepted at the Reinforcement Learning Conference (RLC) 2026. Code available at: https://github.com/lpreuettUW/distributional_point_based_value_iteration