中文

基于多评论家策略梯度优化的无人机协同多智能体强化学习

机器人学 2024-10-30 v1 人工智能 机器学习

摘要

近期无人机(UAV)技术开发进展与购置成本下降,使无人机机队在各类任务中的应用颇具吸引力。在农业、灾害管理、搜救行动、商业与军事应用中,部署无人机机队的优势源于其自主协作能力。旨在优化基于神经网络的控制策略的多智能体强化学习方法(如性能最佳的 actor-critic 策略梯度算法)难以有效反向传播来自不同奖励信号源的误差,且倾向于偏重丰厚信号而忽视协调与对已学相似性的利用。我们提出一种多评论家策略优化架构,具有多个价值估计网络与一种新颖优势函数,可优化随机 actor 策略网络以实现智能体的最优协调。进而,我们将该算法应用于物理引擎强化学习环境中需多无人机协作的若干任务。我们的方法实现了稳定的策略网络更新,以及随智能体数量增加的奖励信号发展相似性。所得策略实现了最优协调与避碰等约束的满足。

关键词

引用

@article{arxiv.2012.15472,
  title  = {Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization},
  author = {Yoav Alon and Huiyu Zhou},
  journal= {arXiv preprint arXiv:2012.15472},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication