中性代理人对抗性策略学习在多方开放系统中的深度强化学习
机器学习
2025-10-14 v1 密码学与安全
摘要
强化学习 (RL) 是解决不确定性下长期序列决策问题的重要机器学习范式。通过将深度神经网络 (DNN) 集成到 RL 框架中,深度强化学习 (DRL) 应运而出,并在多个领域取得显著成功。然而,DNN 的集成也使其易受对抗攻击的威胁。现有对抗攻击技术主要 focus于要么直接操控受害代理人交互的环境,要么部署与受害代理人交互的对抗代理人以诱导异常行为。尽管这些技术取得了令人鼓舞的成果,但在多方开放系统中的应用仍受限于两个主要原因:对环境完全控制的不切实际假设,以及依赖与受害代理人的交互。为在多方开放系统中实现对抗攻击,本文重新设计了一种无需与这些代理人直接交互或对其环境完全控制即可误导已训练受害代理人的对抗策略学习方法。特别地,我们提出了一种在多方开放系统中各种任务场景下的中性代理人方法。尽管中性代理人看似与受害代理人分离,却通过共享环境间接影响它们。我们在基于 Starcraft II 的 SMAC 平台和 Highway-env 自动驾驶仿真平台上评估了所提方法。实验结果表明,该方法能够在多方开放系统中发起通用且有效的对抗攻击。
引用
@article{arxiv.2510.10937,
title = {Neutral Agent-based Adversarial Policy Learning against Deep Reinforcement Learning in Multi-party Open Systems},
author = {Qizhou Peng and Yang Zheng and Yu Wen and Yanna Wu and Yingying Du},
journal= {arXiv preprint arXiv:2510.10937},
year = {2025}
}