面向离线强化学习的Critial Sample-based Gradient-guided Backdoor攻击:CS-GBA
机器学习
2026-01-16 v1
摘要
离线强化学习 (RL)可从静态数据集进行策略优化,但本质上易受到后门攻击。现有攻击策略通常难以应对安全约束算法(如CQL),由于低效的随机投毒以及使用易被检测的分布外 (OOD)触发器。在本文中,我们提出CS-GBA (Critical Sample-based Gradient-guided Backdoor Attack),一种新型框架旨在严格预算下实现高隐身性和破坏性。我们利用样本在时序差分 (TD) 误差上具有高重要性这一理论洞见,引入自适应的Critical Sample Selection策略,将攻击预算集中于最具影响力的转换。为规避ODD检测,我们提出了Correlation-Breaking触发器机制,利用状态特征的物理互斥性(如95th百分位边界)保持统计隐蔽。此外,我们取代常规标签反转,采用Gradient-Guided Action Generation机制,该机制利用受害者Q网络的梯度在数据流形中搜索最坏情况动作。在D4RL基准上的实证结果表明,我们的方法显著优于最先进的基线,仅需5%投毒预算即可针对代表性安全约束算法实现高攻击成功率,同时保持在干净环境中的agent性能。
引用
@article{arxiv.2601.10407,
title = {CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning},
author = {Yuanjie Zhao and Junnan Qiu and Yue Ding and Jie Li},
journal= {arXiv preprint arXiv:2601.10407},
year = {2026}
}