中文

当评论家意见相左:RIS 辅助无线控制系统中的自适应奖励投毒攻击

机器学习 2026-05-20 v1 人工智能

摘要

奖励投毒攻击对基于学习的无线控制系统构成重大风险。鉴于此,我们提出了一种针对 Soft Actor-Critic (SAC) 智能体的分歧引导奖励投毒 (DGRP) 自适应攻击。在由可重构智能表面 (RIS) 辅助的认知无线电网络 (CRN) 环境中,SAC 智能体的任务是通过同时优化次级用户 (SU) 发射器的传输功率和 RIS 相移,来最大化次级用户的长期速率。DGRP 破坏奖励,尤其是在 SAC 双评论家表现出显著分歧时——特别是在高杠杆、高不确定性状态下——导致价值估计失真,并引导策略走向次优动作。我们的研究结果表明,DGRP 显著削弱了 RIS 通常提供的性能改进,并降低了传输质量。我们进一步研究了关键攻击参数,并确定了它们对学习的影响。与周期性定时和探索触发的基线攻击相比,DGRP 始终造成更大的损害,这凸显了在评估 RIS 辅助网络中深度强化学习 (DRL) 的鲁棒性时,考虑感知分歧的威胁的必要性。

关键词

引用

@article{arxiv.2605.20037,
  title  = {When Critics Disagree: Adaptive Reward Poisoning Attacks in RIS-Aided Wireless Control System},
  author = {Deemah H. Tashman and Soumaya Cherkaoui},
  journal= {arXiv preprint arXiv:2605.20037},
  year   = {2026}
}