井中之毒:后门攻击中的特征嵌入破坏
密码学与安全
2025-05-27 v1 机器学习
摘要
后门攻击将恶意触发器嵌入训练数据中,使攻击者能够在推理期间操纵神经网络行为,同时在良性输入上保持高准确率。然而,现有的后门攻击面临局限性,表现为过度依赖训练数据、隐蔽性差和不稳定,这阻碍了它们在实际应用中的有效性。因此,本文介绍了 ShadowPrint,这是一种针对神经网络内特征嵌入的多功能后门攻击,旨在实现高攻击成功率(ASR)和隐蔽性。与传统方法不同,ShadowPrint 减少了对训练数据访问的依赖,并在极低的投毒率(低至 0.01%)下有效运行。它利用基于聚类的优化策略来对齐特征嵌入,确保在多种场景下的稳健性能,同时保持稳定性和隐蔽性。广泛的评估表明,ShadowPrint 在干净标签和脏标签设置下,且投毒率范围从低至 0.01% 到 0.05% 的情况下,实现了卓越的 ASR(高达 100%)、稳定的良性分类准确率(CA)(在大多数情况下衰减不超过 1%)和低防御检测率(DDR)(平均低于 5%),为后门攻击能力设定了新标准,并强调需要针对特征空间操纵制定高级防御策略。
引用
@article{arxiv.2505.19821,
title = {Poison in the Well: Feature Embedding Disruption in Backdoor Attacks},
author = {Zhou Feng and Jiahao Chen and Chunyi Zhou and Yuwen Pu and Qingming Li and Shouling Ji},
journal= {arXiv preprint arXiv:2505.19821},
year = {2025}
}
备注
Accepted to ICME 2025