中文

针对离线强化学习中数据投毒的最优扰动预算分配

机器学习 2025-12-11 v2

摘要

离线强化学习(Offline Reinforcement Learning)通过静态数据集实现策略优化,但本质上易受到数据投毒攻击的威胁。现有攻击策略通常依赖局部均匀扰动,对所有样本样差之外,这种方法效率低下,因为会在低影响样本上浪费扰动预算,且缺乏隐蔽性 due to 显著的统计偏差。本文提出了一种新颖的全局预算分配攻击策略。基于样本对值函数收敛影响与其时序差(TD)误差成正比的理论洞见,我们将攻击建模为全局资源分配问题。在全局L2约束下,我们推导出闭式解,使扰动幅度按TD误差灵敏度成比例分配。在D4RL基准上的实验结果表明,我们的方法显著优于基线策略,在最小扰动下实现了最高80%的性能退化,并且能通过最新统计和谱防御手段进行检测。

关键词

引用

@article{arxiv.2512.08485,
  title  = {Optimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement Learning},
  author = {Junnan Qiu and Yuanjie Zhao and Jie Li},
  journal= {arXiv preprint arXiv:2512.08485},
  year   = {2025}
}