策略空间搜索:等价性、改进与压缩
人工智能
2024-04-01 v1
摘要
完全可观测非确定性规划是人工智能规划中处理不确定性的核心。它通过具有非确定性效果的动作来建模不确定性。带非确定性的A*是一种泛化A*用于FOND规划的规划器。它通过在FOND任务的策略空间上执行显式启发式搜索来搜索解决方案策略。在本文中,我们研究并改进了AND*执行的策略空间搜索的性能。我们提出了一种多项式时间过程,仅根据应映射的状态集即可构建解决方案策略。该过程以及对FOND策略结构的更好理解,使我们能够提出策略之间等价性的三个概念。我们使用策略等价性来剪枝部分策略搜索空间,使AND*在解决FOND任务时更加有效。我们还研究了考虑结构状态空间对称性以加强等价策略检测的影响,以及使用满足性技术进行搜索的影响。我们应用了群论文献中的一项最新技术来更好地计算结构状态空间对称性。最后,我们提出了一种解决方案压缩器,给定一个定义在完整状态上的策略,它能找到一个使用最少部分状态明确表示该策略的策略。引入这些技术的AND*平均生成少两个数量级的策略来解决FOND任务。这些技术使得显式策略空间搜索在覆盖率和解决方案紧凑性方面能够与其他最先进的FOND规划器竞争。
引用
@article{arxiv.2403.19883,
title = {Policy-Space Search: Equivalences, Improvements, and Compression},
author = {Frederico Messa and André Grahl Pereira},
journal= {arXiv preprint arXiv:2403.19883},
year = {2024}
}