中文

困于前门的后门:适得其反的多智能体后门攻击

机器学习 2022-01-31 v1 密码学与安全 多智能体系统

摘要

协作学习与外包数据收集中的恶意智能体威胁干净模型的训练。后门攻击指攻击者在训练期间毒化模型以成功实现定向误分类,是训练时鲁棒性的重大隐患。本文研究多智能体后门攻击场景,其中多个攻击者试图同时对受害模型植入后门。在广泛博弈中观察到一致的反噬现象:智能体集体攻击成功率低下。我们考察不同后门攻击配置模式、非合作/合作、联合分布偏移与博弈设定,得出下界处的均衡攻击成功率。结果促使对实际环境中后门防御研究的重新评估。

关键词

引用

@article{arxiv.2201.12211,
  title  = {Backdoors Stuck At The Frontdoor: Multi-Agent Backdoor Attacks That Backfire},
  author = {Siddhartha Datta and Nigel Shadbolt},
  journal= {arXiv preprint arXiv:2201.12211},
  year   = {2022}
}