中文

Voronoi 渐进扩展:连续状态、动作与观测 POMDP 的高效在线求解器

机器学习 2021-04-02 v3 人工智能 机器人学 系统与控制 系统与控制

摘要

本文提出 Voronoi 渐进扩展(VPW),它是 Voronoi 乐观优化(VOO)和动作渐进扩展到部分可观测马尔可夫决策过程(POMDPs)的推广。树搜索算法可利用 VPW 通过高效平衡局部与全局动作搜索来处理连续或混合动作空间。本文提出两种基于 VPW 的算法,并从理论与仿真角度对其进行分析。Voronoi 乐观加权稀疏采样(VOWSS)是一种证明基于 VPW 的在线求解器合理性的理论工具,并且它是首个对连续状态、动作和观测 POMDP 具有全局收敛保证的算法。Voronoi 乐观蒙特卡洛规划与观测加权(VOMCPOW)是一种通用且高效的算法,在多个仿真实验中持续优于最先进的 POMDP 算法。

关键词

引用

@article{arxiv.2012.10140,
  title  = {Voronoi Progressive Widening: Efficient Online Solvers for Continuous State, Action, and Observation POMDPs},
  author = {Michael H. Lim and Claire J. Tomlin and Zachary N. Sunberg},
  journal= {arXiv preprint arXiv:2012.10140},
  year   = {2021}
}