通过伪相关视角缓解后门投毒攻击
计算与语言
2023-10-23 v2 密码学与安全
摘要
现代 NLP 模型通常在大型不可信数据集上训练,这增加了恶意 adversary 破坏模型行为的可能性。例如,后门可通过构造带有特定文本触发词与目标标签的训练样本植入。本文假设后门投毒攻击在简单文本特征与分类标签之间表现出伪相关(spurious correlation),并据此提出将缓解伪相关作为防御手段。我们的实证研究发现恶意触发词与其目标标签高度相关;因此此类相关性相较于良性特征的相关性得分极为可区分,并可用于过滤潜在问题样本。与若干现有防御相比,我们的防御方法在各类后门攻击中显著降低攻击成功率,且在基于插入的攻击情形下,我们的方法提供了近乎完美的防御。
引用
@article{arxiv.2305.11596,
title = {Mitigating Backdoor Poisoning Attacks through the Lens of Spurious Correlation},
author = {Xuanli He and Qiongkai Xu and Jun Wang and Benjamin Rubinstein and Trevor Cohn},
journal= {arXiv preprint arXiv:2305.11596},
year = {2023}
}
备注
accepted to EMNLP2023 (main conference)