针对离线强化学习中数据投毒的最优扰动预算分配
机器学习
2025-12-11 v2
摘要
离线强化学习(Offline Reinforcement Learning)通过静态数据集实现策略优化,但本质上易受到数据投毒攻击的威胁。现有攻击策略通常依赖局部均匀扰动,对所有样本样差之外,这种方法效率低下,因为会在低影响样本上浪费扰动预算,且缺乏隐蔽性 due to 显著的统计偏差。本文提出了一种新颖的全局预算分配攻击策略。基于样本对值函数收敛影响与其时序差(TD)误差成正比的理论洞见,我们将攻击建模为全局资源分配问题。在全局L2约束下,我们推导出闭式解,使扰动幅度按TD误差灵敏度成比例分配。在D4RL基准上的实验结果表明,我们的方法显著优于基线策略,在最小扰动下实现了最高80%的性能退化,并且能通过最新统计和谱防御手段进行检测。
引用
@article{arxiv.2512.08485,
title = {Optimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement Learning},
author = {Junnan Qiu and Yuanjie Zhao and Jie Li},
journal= {arXiv preprint arXiv:2512.08485},
year = {2025}
}