对抗空域中用于安全 UAV 冲突解脱的元策略切换
机器学习
2025-12-16 v3 人工智能
摘要
使用强化学习 (RL) 的自主无人机 (UAV) 导航容易受到操纵传感器输入的对抗攻击,可能导致不安全行为和任务失败。尽管鲁棒 RL 方法提供了部分保护,但由于依赖固定的扰动设置,它们通常难以泛化到未见过或分布外 (OOD) 的攻击。为了解决这一局限性,我们提出了一种元策略切换框架,其中元级策略动态地在多个鲁棒策略中进行选择,以应对未知的对抗性偏移。该框架的核心是一个折扣 Thompson 采样 (DTS) 机制,它将策略选择建模为多臂老虎机问题,从而通过自诱导对抗观测最小化价值分布偏移。我们首先构建了一个在不同扰动强度下训练的、动作鲁棒策略的多样化集成。随后,基于 DTS 的元策略在线自适应地在这些策略中进行选择,优化针对自诱导分段平稳攻击的弹性。理论分析表明,DTS 机制能够最小化预期遗憾,确保对 OOD 攻击的自适应鲁棒性,并在不确定性下表现出涌现的反脆弱行为。在复杂 3D 障碍物环境中,针对白盒 (Projected Gradient Descent) 和黑盒 (GPS spoofing) 攻击的大量仿真表明,与标准鲁棒和原始 RL 基线相比,导航效率和更高无冲突轨迹率均得到显著提升,突出了所提方法在实际安全性和可靠性方面的优势。
引用
@article{arxiv.2506.21127,
title = {Meta Policy Switching for Secure UAV Deconfliction in Adversarial Airspace},
author = {Deepak Kumar Panda and Weisi Guo},
journal= {arXiv preprint arXiv:2506.21127},
year = {2025}
}