学习引导的优先级规划:面向仓库自动化的终身多智能体路径规划
人工智能
2026-03-26 v1 机器人学
摘要
终身多智能体路径规划(MAPF)对于现代仓库自动化至关重要,需要多个机器人持续导航冲突-free路径以优化整个系统的吞吐量。然而,仓库环境的复杂性以及终身MAPF的长期动态往往需要对经典基于搜索的求解器进行高成本的调整。虽然探索了机器学习方法,但其相对于基于搜索的方法的优势尚不明确。本文引入了基于强化学习引导的滚动时域优先级规划框架(RL-RH-PP),这是首个将RL与基于搜索的规划集成用于终身MAPF的框架。具体而言,我们以经典的优先级规划(PP)作为框架,其简单性和灵活性使其能够与学习基于优先级分配策略的集成相结合。通过将动态优先级分配建模为部分可观测马尔可夫决策过程(POMDP),RL-RH-PP利用终身规划中顺序决策的特性,同时将复杂的时空智能体相互作用委托给强化学习。一种基于注意力的神经网络自回归地解码优先级顺序,使PP规划器能够高效地进行顺序单智能体规划。在真实的仓库仿真环境中的评估表明,RL-RH-PP在基线方法中实现了最高的总吞吐量,并在智能体密度、规划时域和仓库布局之间实现了有效的泛化。我们的解释性分析揭示,RL-RH-PP主动优先级排序拥挤的智能体,并战略性地将智能体从拥挤处重新定向,从而减轻交通流量并提升吞吐量。这些发现凸显了学习引导方法在现代仓库自动化中补充传统启发式方法的潜力。
引用
@article{arxiv.2603.23838,
title = {Learning-guided Prioritized Planning for Lifelong Multi-Agent Path Finding in Warehouse Automation},
author = {Han Zheng and Yining Ma and Brandon Araki and Jingkai Chen and Cathy Wu},
journal= {arXiv preprint arXiv:2603.23838},
year = {2026}
}