通过生成式触发器优化打破干净图像后门的隐蔽性-效力权衡
计算机视觉与模式识别
2025-11-12 v2 密码学与安全
机器学习
摘要
干净图像后门攻击使用仅限于标签操纵的训练数据集来危害深度神经网络,构成了面向安全关键应用的重大威胁。现有方法的一个关键缺陷是,成功攻击所需的中毒率会导致干净准确率(CA)按比例下降,从而削弱其隐蔽性。本文提出了一种新的干净图像攻击范式,通过优化触发器本身来最小化此准确率降低。我们引入生成式干净图像后门(GCB),该框架使用条件InfoGAN识别可作为高效且隐蔽触发器的自然图像特征。通过确保这些触发器易于从恶意任务相关特征中分离,GCB使受害模型能够从极少的受感染示例中学习后门,导致CA下降不足1%。我们的实验表明,GCB在六个数据集、五种网络结构和四个任务上具有惊人的多样性,包括首次在回归和分割任务中演示干净图像后门。GCB还对大多数现有后门防御措施具有韧性。
引用
@article{arxiv.2511.07210,
title = {Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization},
author = {Binyan Xu and Fan Yang and Di Tang and Xilin Dai and Kehuan Zhang},
journal= {arXiv preprint arXiv:2511.07210},
year = {2025}
}
备注
19 pages, 22 figures, 15 tables. To appear in AAAI '26 (Oral). This paper extends the AAAI-2026 version by including the Appendix