UAV-MARL:用于时效性和动态医疗物资投递的多智能体强化学习
机器学习
2026-03-12 v1 人工智能
摘要
无人机 (UAV) 越来越多地用于支持时效性医疗物资投递,在紧急情况和资源短缺时提供快速灵活的物流。然而,有效部署无人机编队需要具备优先级排序、分配有限空中资源以及在不确定运行条件下适应投递计划的协调机制。本文提出了一套用于协调时序医疗投递情境中无人机编队的多智能体强化学习 (MARL) 框架,其中请求在紧急程度、位置和投递截止时间方面各不相同。该问题被建模为部分可观测马尔可夫决策过程 (POMDP),其中无人机代理保持对医疗投递需求的 awareness,但由于通信和定位限制,无法看到其他代理。该框架采用 Proximal Policy Optimization (PPO) 作为主要学习算法,并评估了包括异步扩展、经典 actor--critic 方法以及架构修改在内的各种变体,以分析可扩展性和性能之间的权衡。该模型使用从 OpenStreetMap 数据集中提取的选定诊所和医院的真实地理数据进行评估。该框架提供了一个决策支持层,优先级排序医疗任务,实时重新分配无人机资源,并协助医护人员管理紧急物流。实验结果表明,经典 PPO 在协调性能上优于异步和顺序学习策略,凸显了强化学习在自适应和可扩展 UAV辅助医疗物流中的潜力。
引用
@article{arxiv.2603.10528,
title = {UAV-MARL: Multi-Agent Reinforcement Learning for Time-Critical and Dynamic Medical Supply Delivery},
author = {Islam Guven and Mehmet Parlak},
journal= {arXiv preprint arXiv:2603.10528},
year = {2026}
}
备注
7 pages, 4 figures, 2 tables, conference