Backbone 是关键:冻结基础模型在合成图像侦 forensics 中的漏洞性评估
计算机视觉与模式识别
2026-05-14 v1 多媒体
摘要
随着 AI 生成的合成图像逐渐逼真,Vision Transformers (ViTs) 已成为现代 deepfake 检测的核心。然而,依赖冻结预训练 backbone 的做法引入了细微但关键的漏洞。本文提出了 Surrogate Iterative Adversarial Attack (SIAA),一种灰箱攻击,仅利用目标检测器 backbone 的知识,完全在目标检测器的特征空间内 crafting 高效对抗样本。通过实验,涉及多个基于 ViT 的检测器和多种灰箱情景,包括 few-shot 学习、完全训练错位和攻击迁移性测试,我们展示该漏洞始终产生高攻击成功率,常常接近白箱性能。通过此方式,我们揭示了仅凭 backbone 知识即可削弱检测器可靠性,凸显了对抗多媒体 forensics 所需更鲁棒防御的紧迫性。
引用
@article{arxiv.2605.13381,
title = {Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics},
author = {Chiara Musso and Joy Battocchio and Andrea Montibeller and Giulia Boato},
journal= {arXiv preprint arXiv:2605.13381},
year = {2026}
}