基于多代理强化学习的单向目标追逐:设计与实验
多智能体系统
2025-06-30 v2 机器人学
系统与控制
系统与控制
摘要
本文解决了针对未知目标的多机器人追逐问题,涵盖目标状态估计与追逐控制两个方面。首先,在状态估计方面,我们专注于仅使用方位信息,因为方位信息易于从视觉传感器获取,且对小型远程目标效果良好。针对方位测量非线性导致的不稳定性以及两种角度表示中的奇点问题,本文提出了一种统一的单向信息滤波器。该滤波器整合了多个 3D 方位测量,提供简洁的表述,增强了鲁棒性和对因视野(FoV)有限而导致的目标丢失的抗压能力。其次,在复杂环境中的目标追逐控制方面,由于异构性和有限 FoV 等挑战,诸如微分博弈或 Voronoi 分区等传统方法往往难以满足需求。为此,本文提出一种新型的多代理强化学习(MARL)框架,使多个异构车辆能够搜索、定位并跟随目标,同时有效处理上述挑战。再者,为弥合仿真与现实之间的差距,本文提出两种关键技术:在训练中加入可调的低层控制增益以复制现实中自主地面车辆(AGV)的动力学,以及提出谱归一化 RL 算法以提高策略的平滑性和鲁棒性。最后,我们展示了 MARL 控制器能够实现从仿真到 AGV 的零样迁移,验证了方法的有效性和实际可行性。附属视频可在 https://youtu.be/HO7FJyZiJ3E 观看。
引用
@article{arxiv.2503.08740,
title = {Cooperative Bearing-Only Target Pursuit via Multiagent Reinforcement Learning: Design and Experiment},
author = {Jianan Li and Zhikun Wang and Susheng Ding and Shiliang Guo and Shiyu Zhao},
journal= {arXiv preprint arXiv:2503.08740},
year = {2025}
}
备注
To appear in the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)