中文

ARBoids:基于 Boids 模型的自适应残差强化学习用于多 USV 目标防御

机器学习 2025-11-26 v3 密码学与安全 机器人学

摘要

无人舰舱 (USV) 的目标防御问题 (TDP) 涉及使用一个或多个防御 USV 在其越过指定目标区域前拦截攻击 USV。当攻击者的机动性优于防御者时,特别 challenging 的场景会显著复杂化有效拦截。为解决此问题,本文引入 ARBoids,一种新型自适应残差强化学习框架,将深度强化学习 (DRL) 与生物学启发的基于力的 Boids 模型相结合。在该框架中,Boids 模型作为多智能体协调的计算高效基线策略,而 DRL 学习残差策略以自适应地细化和优化防御者的动作。该方法在高保真 Gazebo 模拟环境中验证,表现优于传统拦截策略,包括纯力基于方法和 vanilla DRL 策略。此外,所学策略对具有不同机动性特征的攻击者表现出强大的适应性,凸显其鲁棒性和泛化能力。ARBoids 的代码将在本文接受后公开。

关键词

引用

@article{arxiv.2502.18549,
  title  = {ARBoids: Adaptive Residual Reinforcement Learning With Boids Model for Cooperative Multi-USV Target Defense},
  author = {Jiyue Tao and Tongsheng Shen and Dexin Zhao and Feitian Zhang},
  journal= {arXiv preprint arXiv:2502.18549},
  year   = {2025}
}