中文

离线强化学习中针对投毒攻击的多层次认证防御

机器学习 2025-05-28 v1 人工智能

摘要

类似于其他机器学习框架,离线强化学习 (RL) 因其依赖外部数据集而易受到投毒攻击,这种脆弱性因其顺序性质而加剧。为缓解RL投毒带来的风险,我们扩展了认证防御,提供更大的对抗操纵保证,确保对每个状态的动作以及整体预期累积奖励都具有鲁棒性。我们的做法利用微分隐私的性质,使本工作能够覆盖连续与离散空间,以及随机与确定性环境——显著扩展了可实现保证的范围和适用性。经验评估表明,我们的方法确保在最高可达7%训练数据被投毒的情况下,性能下降不超过50%,显著优于 prior work \citep{wu_copa_2022} 中的 0.008%,同时产生的认证半径也大约是其5倍。这突显了本框架在提升离线RL的安全性和可靠性方面的潜力。

关键词

引用

@article{arxiv.2505.20621,
  title  = {Multi-level Certified Defense Against Poisoning Attacks in Offline Reinforcement Learning},
  author = {Shijie Liu and Andrew C. Cullen and Paul Montague and Sarah Erfani and Benjamin I. P. Rubinstein},
  journal= {arXiv preprint arXiv:2505.20621},
  year   = {2025}
}