中文

通过快速状态空间采样扩展长视界在线POMDP规划

机器人学 2024-11-12 v1

摘要

部分可观测马尔可夫决策过程(POMDP)是不确定性下运动规划的一个通用且原理性的框架。尽管POMDP求解器的可扩展性取得了巨大改进,长视界POMDP(例如≥15步)仍然难以求解。本文提出了一种新的近似在线POMDP求解器,称为基于参考的快速状态空间采样在线POMDP规划(ROP-RaS3)。ROP-RaS3使用新颖的极快基于采样的运动规划技术来采样状态空间,并在线生成一组多样化的宏观动作,然后利用这些动作来偏置信念空间采样并推断高质量策略,而无需穷举枚举动作空间——这是现代在线POMDP求解器的基本约束。ROP-RaS3在各种长视界POMDP上进行了评估,包括一个规划视界超过100步的问题和一个需要超过20步前瞻的15维状态空间问题。在所有这些问题中,ROP-RaS3以多达数倍的优势大幅超越了其他最先进的方法。

关键词

引用

@article{arxiv.2411.07032,
  title  = {Scaling Long-Horizon Online POMDP Planning via Rapid State Space Sampling},
  author = {Yuanchu Liang and Edward Kim and Wil Thomason and Zachary Kingston and Hanna Kurniawati and Lydia E. Kavraki},
  journal= {arXiv preprint arXiv:2411.07032},
  year   = {2024}
}

备注

16 pages, 4 tables, 1 figure. To be presented at the International Symposium of Robotics Research 2024