TextGuard:针对文本分类后门攻击的可证明防御
机器学习
2023-11-28 v2 密码学与安全
摘要
后门攻击已成为在安全关键应用中部署机器学习模型的主要安全威胁。现有研究工作已提出许多针对后门攻击的防御方法。尽管这些方法展现出了一定的经验防御效果,但均无法提供针对任意攻击的形式化、可证明的安全保证。正如我们的评估所示,它们很容易被强自适应攻击攻破。在本工作中,我们提出 TextGuard,这是首个针对文本分类后门攻击的可证明防御。具体而言,TextGuard 首先通过将每个训练句子拆分为子句子,将(被植入后门的)训练数据划分为子训练集。这种划分确保大多数子训练集不包含后门触发器。随后,从每个子训练集训练一个基分类器,其集成提供最终预测。我们从理论上证明,当后门触发器的长度落在某一阈值内时,TextGuard 保证其预测不受训练和测试输入中触发器存在的影响。在我们的评估中,我们在三个基准文本分类任务上展示了 TextGuard 的有效性,其认证精度超越了现有针对后门攻击的认证防御。此外,我们提出了增强 TextGuard 经验性能的额外策略。与最先进的经验防御方法的比较验证了 TextGuard 在应对多种后门攻击方面的优越性。我们的代码和数据可在 https://github.com/AI-secure/TextGuard 获取。
引用
@article{arxiv.2311.11225,
title = {TextGuard: Provable Defense against Backdoor Attacks on Text Classification},
author = {Hengzhi Pei and Jinyuan Jia and Wenbo Guo and Bo Li and Dawn Song},
journal= {arXiv preprint arXiv:2311.11225},
year = {2023}
}
备注
Accepted by NDSS Symposium 2024