中文

基于 POMDP 的对象搜索:扩张状态空间与混合动作域

机器人学 2026-04-17 v1

摘要

在包含多样化家具(如货架、桌子和床)的复杂室内环境中高效定位目标对象是移动机器人面临的重大挑战。此挑战源于定位误差、视野受限和视觉遮挡等因素。我们将对象搜索任务建模为具有扩张状态空间和混合(连续与离散)动作空间的高维部分可观测马尔可夫决策过程(POMDP)。基于精心设计的感知模块,我们提出了名为 growing neural process filtered k-center clustering tree(GNPF-kCT)的新型在线 POMDP 求解器来解决该问题。通过对belief tree 的复用实现扩张状态空间的蒙特卡洛树搜索(MCTS),利用神经过程网络筛选无用原始动作,并采用 k-center 聚类球形离散化高效细化高维动作空间。改进的上置置信界(UCB)基于belief 差异和单元格内动作价值函数(估计直径)引导MCTS扩张。理论分析验证了该方法的收敛性和性能潜力。为解决信息或奖励有限的场景,我们还引入 guessed target object 及其网格世界模型作为提升搜索效率的关键策略。大量 Gazebo 模拟实验表明,在相同的计算资源和感知系统下,GNPF-kCT 在对象搜索任务中显著优于 POMDP 基线方法和最新无POMDP求解器(尤其是基于大语言模型的方法),实现更快更可靠的目标定位。实际室内办公环境测试确认了该方法的实用性。项目页面:https://sites.google.com/view/gnpfkct。

关键词

引用

@article{arxiv.2604.14965,
  title  = {POMDP-based Object Search with Growing State Space and Hybrid Action Domain},
  author = {Yongbo Chen and Hesheng Wang and Shoudong Huang and Hanna Kurniawati},
  journal= {arXiv preprint arXiv:2604.14965},
  year   = {2026}
}