中文

从策略分布视角重新思考强化学习中的对抗攻击

机器学习 2025-01-09 v2 人工智能

摘要

深度强化学习 (DRL) 在实际应用中因观测信号的不确定性和不准确性而受到影响。对抗攻击是评估 DRL 智能体鲁棒性的有效方法。然而,现有针对单个抽样动作的攻击方法对整体策略分布影响有限,尤其是在连续动作空间中。为解决这些限制,我们提出了分布感知投影梯度下降攻击 (DAPGD)。DAPGD 采用分布相似性作为梯度扰动输入,以策略分布为攻击目标,能够利用整个策略分布而不依赖于单个样本。我们在 DAPGD 中使用巴哈拉希亚距离来衡量策略相似性,以敏感地检测概率分布之间的细微但关键差异。我们的实验结果表明,DAPGD 在三个机器人导航任务中相对于基线实现了 SOTA 成果,平均奖励下降幅度比最佳基线高出 22.03%。

关键词

引用

@article{arxiv.2501.03562,
  title  = {Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective},
  author = {Tianyang Duan and Zongyuan Zhang and Zheng Lin and Yue Gao and Ling Xiong and Yong Cui and Hongbin Liang and Xianhao Chen and Heming Cui and Dong Huang},
  journal= {arXiv preprint arXiv:2501.03562},
  year   = {2025}
}

备注

10 pages, 2 figures, 2 tables