TERL:基于 Transformer 增强强化学习的大规模多目标包围
机器人学
2025-08-28 v2 机器学习
摘要
追逃问题是多机器人系统中的关键挑战。虽然强化学习 (RL) 在解决追逃任务方面显示出前景,但研究主要聚焦于单目标追逃,对于大规模环境下的多目标包围探索有限。本文提出一种 Transformer 增强强化学习 (TERL) 框架,用于大规模多目标包围。通过将基于 Transformer 的策略网络与目标选择集成,TERL 使机器人能够自适应地优先排序目标并安全协调机器人。结果表明,TERL 在包围成功率和任务完成时间方面均优于现有的基于 RL 的方法,同时在大规模场景中保持良好性能。值得注意的是,TERL 在小规模场景(15 个追逃者,4 个目标)上训练后,能无需重新训练地有效推广至大规模场景(80 个追逃者,20 个目标),实现 100% 的成功率。代码和演示视频已提供:https://github.com/ApricityZ/TERL。
引用
@article{arxiv.2503.12395,
title = {TERL: Large-Scale Multi-Target Encirclement Using Transformer-Enhanced Reinforcement Learning},
author = {Heng Zhang and Guoxiang Zhao and Xiaoqiang Ren},
journal= {arXiv preprint arXiv:2503.12395},
year = {2025}
}
备注
Accepted to the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)