TrojFlow:流模型是面向特洛伊格攻击的自然目标
计算机视觉与模式识别
2024-12-24 v1 人工智能
摘要
流式生成模型 (FMs) 近期快速发展,作为将噪声映射到数据的有效方法,其高效的训练和采样过程使其在各个领域具有广泛应用。FMs 可视为扩散模型 (DMs) 的一种变体。同时,先前的研究表明,DMs 容易受到特洛伊格/后门攻击,这是一种以恶意嵌入模式触发的输出操纵攻击。我们发现,针对生成模型的特洛伊格攻击本质上等价于从后门分布到目标分布进行图像迁移的任务,FMs 能够拟合任意两个分布的独特能力显著简化了攻击 FMs 的训练和采样 setup,使其成为天然的后门攻击目标。本文提出了 TrojFlow,通过特洛伊格攻击探索 FMs 的漏洞。具体而言,我们考虑各种攻击场景及其组合,彻底探索现有 DM 防御方法是否能有效防御我们的攻击场景。我们在 CIFAR-10 和 CelebA 数据集上评估了 TrojFlow,实验表明该方法能够以高效用和特异性破坏 FMs,且容易突破现有防御机制。
引用
@article{arxiv.2412.16512,
title = {TrojFlow: Flow Models are Natural Targets for Trojan Attacks},
author = {Zhengyang Qi and Xiaohua Xu},
journal= {arXiv preprint arXiv:2412.16512},
year = {2024}
}
备注
6 pages, 4 figures