用于 AUV 编队控制与避障的多智能体生成对抗交互式自模仿学习
机器人学
2024-01-23 v1 机器学习
摘要
多自主水下航行器能够在协作下完成单台 AUV 无法完成的任务。近期,多智能体强化学习已被引入多 AUV 控制中。然而,为多 AUV 控制的各种任务设计高效的奖励函数是困难甚至不切实际的。多智能体生成对抗模仿学习允许 multi-AUV 从专家演示中学习,而非依赖预定义的奖励函数,但其存在需要最优演示且无法超越所提供专家演示的缺陷。本文在 MAGAIL 算法的基础上,提出多智能体生成对抗交互式自模仿学习(MAGAISIL),通过逐渐用人类训练者挑选的自生成优质轨迹替代所提供的次优演示,促进 AUV 学习策略。我们在 Gazebo 平台上使用本实验室的 AUV 模拟器进行多 AUV 编队控制与避障任务的实验,结果表明,通过 MAGAISIL 训练的 AUV 能够超越所提供的次优专家演示,并达到接近甚至优于使用最优演示的 MAGAIL 的性能。进一步结果表明,通过 MAGAISIL 训练的 AUV 策略能够像从最优演示中学习的 MAGAIL 一样适应复杂且不同的任务。
引用
@article{arxiv.2401.11378,
title = {Multi-Agent Generative Adversarial Interactive Self-Imitation Learning for AUV Formation Control and Obstacle Avoidance},
author = {Zheng Fang and Tianhao Chen and Dong Jiang and Zheng Zhang and Guangliang Li},
journal= {arXiv preprint arXiv:2401.11378},
year = {2024}
}
备注
8pages,10figures,Published to RA-L