基于强化学习的多智能体避障设计与实现
机器人学
2022-10-25 v1
摘要
智能体及多智能体系统在无人机群控制系统等场景中扮演重要角色,而作为高级应用基础功能的多智能体导航与避障具有重大意义。在多智能体导航与避障任务中,随着环境复杂度提升,智能体的决策交互与动态变化使传统路径规划算法或强化学习算法难以应对。经典多智能体强化学习算法多智能体深度确定性策略梯度(MADDPG)解决了先前算法训练过程非平稳及无法处理环境随机性的问题。然而,MADDPG 忽略了智能体与环境交互中隐藏的时序信息。此外,由于其 CTDE 技术令每个智能体的 critic 网络基于所有智能体的动作与整体环境信息计算,其难以扩展至更大量级的智能体。针对 MADDPG 对数据时序信息的忽视,本文提出一种结合 MADDPG 与长短期记忆(LSTM)的新算法 MADDPG-LSTMactor。该算法将智能体连续时间步的观测作为其策略网络输入,使 LSTM 层处理隐藏的时序信息。实验结果表明,该算法在智能体数量较少的场景中表现更优。此外,为解决 MADDPG 在智能体过多时效率不佳的缺陷,本文提出轻量级 MADDPG(MADDPG-L)算法,简化 critic 网络输入。实验结果显示,当智能体数量较大时,该算法性能优于 MADDPG。
引用
@article{arxiv.2210.12927,
title = {The Design and Realization of Multi-agent Obstacle Avoidance based on Reinforcement Learning},
author = {Enyu Zhao and Chanjuan Liu and Houfu Su and Yang Liu},
journal= {arXiv preprint arXiv:2210.12927},
year = {2022}
}