面向任务导向无人机网络的能感知多智能体强化学习扩展研究
网络与互联网体系结构
2026-05-26 v1 人工智能
机器学习
多智能体系统
摘要
多智能体强化学习(MARL)因其通过交互学习的能力,已在自动驾驶和智慧城市等协作系统中广泛应用。近期无人机网络的发展也推动了 MARL 应用于解决轨迹规划问题。然而,动态环境和无人机有限的电池容量仍是使用 MARL 实现高效协作任务执行的挑战。本文提出一种能感知 MARL 模型以应对上述挑战,采用由任务执行进度和无人机剩余电量驱动的\emph{individual reward functions}的深度 Q 网络(DQN)。我们对提议方法进行仿真实验,并与共享奖励 MARL 进行比较,探讨 MARL 中信用分配的影响。结果表明,提议模型无论任务位置和长度如何,均可实现至少 80% 的成功率。类似于共享奖励模式,individual reward 模式在任务密度较高时可获得更高的成功率,任务密度接近 40% 时可接近 100% 成功率。提议模型的真正优势在于扩展环境时显现出来。与共享奖励 MARL 的比较显示,提议模型对环境规模和智能体数量的变化更稳健。它可通过更少的步骤实现更高的成功率,因为目标更加明确,从而提高能源效率。
引用
@article{arxiv.2605.24992,
title = {Scaling up Energy-Aware Multi-Agent Reinforcement Learning for Mission-Oriented Drone Networks with Individual Reward},
author = {Changling Li and Ying Li},
journal= {arXiv preprint arXiv:2605.24992},
year = {2026}
}
备注
IEEE Internet of Things Journal