制作隐形毒药的终极食谱:利用样式属性打造细微的洁净标签文本后门
机器学习
2025-04-25 v1
摘要
文本分类器的后门攻击会导致它们在特定“触发器”存在时预测预定义标签。先前的攻击常依赖不可语法或其他不寻常的触发器,导致攻击显眼。因此,人类标注员——在实践中负责 curate 训练数据的关键角色——可以在手动检查时轻易检测并过滤这些不自然的文本,从而降低此类攻击的风险。我们认为,成功攻击的关键标准是:带有触发器和不带触发器的文本对人类而言不可区分。然而,先前的工作既未直接也未全面地就攻击的隐形性进行人为评估。我们通过开展彻底的人类评估来评估攻击的隐形性。我们还提出了由三个配方构成的 AttrBkd,用于打造细微且有效的触发器属性,例如从现有基线后门攻击中提取细粒度属性。我们的人员评估发现,AttrBkd 采用这些基线派生的属性在攻击成功率方面往往更有效,在人类检测的实例数方面则更隐蔽,表明后门攻击可以通过变得不显眼、在仔细检查时看起来自然来规避检测,同时仍保持有效性。我们的人员标注还提供了先前工作中未捕获的自动化指标未能捕获的信息,并表明这些指标与人类判断存在偏离。
引用
@article{arxiv.2504.17300,
title = {The Ultimate Cookbook for Invisible Poison: Crafting Subtle Clean-Label Text Backdoors with Style Attributes},
author = {Wencong You and Daniel Lowd},
journal= {arXiv preprint arXiv:2504.17300},
year = {2025}
}
备注
Accepted at SaTML 2025