面向无折扣可达性目标POMDP的可靠启发式搜索值迭代
人工智能
2024-06-06 v1 计算机科学中的逻辑
机器人学
系统与控制
系统与控制
摘要
部分可观测马尔可夫决策过程(POMDP)是处理转移和观测不确定性下序贯决策的强大模型。本文研究POMDP中一个具有挑战性且重要的问题,即(不定时域)最大可达概率问题(MRPP),其目标是最大化到达某些目标状态的概率。这也是具有逻辑规约的模型检验中的核心问题,且自然无折扣(折扣因子为1)。受为折扣问题开发的基于点方法成功的启发,我们研究其在MRPP上的扩展。具体而言,我们聚焦于基于试验的启发式搜索值迭代技术,并提出一种新颖算法,该算法利用这些技术在信念空间高效探索(通过值边界进行信息搜索)的优势,同时解决它们在处理不定时域问题中循环的缺点。该算法生成具有最优可达概率双边边界的策略。我们证明在特定条件下算法从下方收敛到最优策略。在一组基准测试上的实验评估表明,我们的算法在几乎所有情况下在概率保证和计算时间方面均优于现有方法。
引用
@article{arxiv.2406.02871,
title = {Sound Heuristic Search Value Iteration for Undiscounted POMDPs with Reachability Objectives},
author = {Qi Heng Ho and Martin S. Feather and Federico Rossi and Zachary N. Sunberg and Morteza Lahijanian},
journal= {arXiv preprint arXiv:2406.02871},
year = {2024}
}
备注
Accepted to the Conference on Uncertainty in Artificial Intelligence (UAI) 2024