中文

分析深度强化学习中的对抗性输入

机器学习 2026-05-05 v2

摘要

近年来,深度强化学习(DRL)因其在现实世界和复杂系统中的成功应用,已成为机器学习中一种流行的范式。然而,即使是当前最先进的DRL模型,也被证明存在可靠性问题——例如,它们易受对抗性输入的影响,即那些微小且大量的输入扰动,可以欺骗模型做出不可预测且潜在危险的决策。这一缺点限制了DRL系统在安全关键领域的部署,在这些领域,即使是很小的错误也不能容忍。在这项工作中,我们通过形式化验证的视角,对对抗性输入的特征进行了全面分析。具体来说,我们提出了对抗率,这是一个改编自ProVe系列的度量标准,用于系统评估DRL中的对抗性输入,它将输入域划分为子区域,以实现对抗性输入的量化与空间可视化。本工作的主要贡献是为对抗性输入对DRL策略的影响提供了一个全面的评估框架。我们提出了一套用于其计算的工具和算法。我们的分析实证地展示了对抗性输入如何影响给定DRL系统在此类扰动下的安全性。此外,我们分析了这些配置的行为,以提出若干有用的实践和指南,帮助减轻已训练DRL网络的脆弱性。

关键词

引用

@article{arxiv.2402.05284,
  title  = {Analyzing Adversarial Inputs in Deep Reinforcement Learning},
  author = {Davide Corsi and Guy Amir and Guy Katz and Alessandro Farinelli},
  journal= {arXiv preprint arXiv:2402.05284},
  year   = {2026}
}

备注

Accepted to AISoLA 2025