基于 Bandit 大邻域搜索的自适应任意时刻多智能体路径规划
人工智能
2024-01-02 v2 多智能体系统
摘要
任意时刻多智能体路径规划(MAPF)是大规模多智能体系统中实现可扩展路径优化的一种有前景的方法。最先进的任意时刻 MAPF 基于大邻域搜索(LNS),其中通过使用随机破坏启发式和优先规划,迭代地破坏并修复初始解中固定数量的部分(即邻域)以进行优化。尽管近期在各种 MAPF 实例中取得了成功,但当前基于 LNS 的方法由于采用固定邻域大小的贪婪优化,缺乏探索能力和灵活性,这通常会导致解的质量较低。到目前为止,这些局限性一直通过在规划之外进行的大量调参工作或离线机器学习来解决。在本文中,我们关注 LNS 中的在线学习,并提出了基于 Bandit 的自适应大邻域搜索结合探索(BALANCE)。BALANCE 采用双层多臂赌博机方案,在搜索过程中动态自适应地选择破坏启发式和邻域大小。我们在 MAPF 基准集的多个地图上评估了 BALANCE,并实证证明在大规模场景下,与最先进的任意时刻 MAPF 相比,成本降低了至少 50%。我们发现,与其他多臂赌博机算法相比,Thompson Sampling 表现尤为出色。
引用
@article{arxiv.2312.16767,
title = {Adaptive Anytime Multi-Agent Path Finding Using Bandit-Based Large Neighborhood Search},
author = {Thomy Phan and Taoan Huang and Bistra Dilkina and Sven Koenig},
journal= {arXiv preprint arXiv:2312.16767},
year = {2024}
}
备注
Accepted to AAAI 2024