困于前门的后门:适得其反的多智能体后门攻击
机器学习
2022-01-31 v1 密码学与安全
多智能体系统
摘要
协作学习与外包数据收集中的恶意智能体威胁干净模型的训练。后门攻击指攻击者在训练期间毒化模型以成功实现定向误分类,是训练时鲁棒性的重大隐患。本文研究多智能体后门攻击场景,其中多个攻击者试图同时对受害模型植入后门。在广泛博弈中观察到一致的反噬现象:智能体集体攻击成功率低下。我们考察不同后门攻击配置模式、非合作/合作、联合分布偏移与博弈设定,得出下界处的均衡攻击成功率。结果促使对实际环境中后门防御研究的重新评估。
引用
@article{arxiv.2201.12211,
title = {Backdoors Stuck At The Frontdoor: Multi-Agent Backdoor Attacks That Backfire},
author = {Siddhartha Datta and Nigel Shadbolt},
journal= {arXiv preprint arXiv:2201.12211},
year = {2022}
}