随机奖励收集游戏:多机器人系统中的战略规划
机器人学
2025-10-29 v1
摘要
团队导向问题 (TOP) 泛化了许多在自主移动、空中物流和监视应用中发生的多机器人调度和路由任务。虽然存在许多针对多机器人系统中规划的 TOP 变体,但它们假设所有机器人致力于单一目标;因此,无法扩展到机器人在奖励稀缺环境中竞争的情形。我们提出随机奖励收集游戏 (SPCG) 作为 TOP 的扩展,用于在存在自感兴趣机器人、图上能源约束和随机转换的环境中进行规划。对完全图和星形图的理论研究表明,SPCG 中存在唯一的纯纳什均衡,与基于排名规则的冲突解决机制下等效 TOP 的最优路由解决方案相吻合。本文提出了两个算法:序数排名搜索 (ORS) 用于获取''序数排名''——在游戏阶段中暂时形成的局部社区中的有效排名;以及虚构序数响应学习 (FORL) 用于获取针对高级排名对手的最佳响应策略。在道路网络和合成图上进行的经验评估显示,1) OR 条件化导致的状态别名使学习的策略在大规模团队规模方面比使用全局指数训练的策略更高效;2) 使用 FORL 训练的策略在不平衡奖励分布方面优于其他多智能体训练方法。最后,SPCG 中学习到的策略实现了 87% 至 95% 的最优性,与通过混合整数线性规划获得的等效 TOP 解决方案相比较。
引用
@article{arxiv.2510.24515,
title = {Stochastic Prize-Collecting Games: Strategic Planning in Multi-Robot Systems},
author = {Malintha Fernando and Petter Ögren and Silun Zhang},
journal= {arXiv preprint arXiv:2510.24515},
year = {2025}
}
备注
Submitted to IEEE Robotics and Automation Letters