中文

针对深度强化学习中时间相关数据的成员推断攻击

机器学习 2022-11-17 v3 密码学与安全

摘要

尽管深度强化学习领域已取得显著研究进展,但文献中尚无专门用于研究深度强化学习算法对成员推断攻击脆弱性的具体对抗攻击策略。在此类攻击系统中,对手的目标是深度强化学习算法训练所依据的已收集输入数据集。为弥补这一空白,我们提出一个对抗攻击框架,旨在测试最先进的深度强化学习算法对成员推断攻击的脆弱性。特别地,我们设计了一系列实验,以探究强化学习训练数据中自然存在的时间相关性对信息泄露概率的影响。此外,我们比较了针对深度强化学习算法的\emph{集体}和\emph{个体}成员攻击的性能。实验结果表明,所提出的对抗攻击框架在推断数据方面出奇有效,在三个不同的Mujoco连续控制任务中,个体模式准确率超过84%84\%,集体模式超过97%97\%,这引发了对此方面严重的隐私担忧。最后,我们表明强化学习算法的学习状态会显著影响隐私泄露的程度。

关键词

引用

@article{arxiv.2109.03975,
  title  = {Membership Inference Attacks Against Temporally Correlated Data in Deep Reinforcement Learning},
  author = {Maziar Gomrokchi and Susan Amin and Hossein Aboutalebi and Alexander Wong and Doina Precup},
  journal= {arXiv preprint arXiv:2109.03975},
  year   = {2022}
}