面向异构生成威胁的体系结构无关特征协同通用防御
密码学与安全
2026-03-17 v1 人工智能
摘要
生成式 AI 的部署正带来内容安全和隐私方面的前所未有的挑战。然而,现有防御机制往往针对特定体系结构(如扩散模型或 GAN)进行定制,形成脆弱的“防御孤岛”,在面对异构生成威胁时会失效。本文识别出朴素像素空间集成策略的一个根本优化障碍:由于目标函数不同,来自异构生成器的像素级梯度在统计上呈正交,从而导致毁灭性干扰。为克服这一问题,我们观察到尽管低层机制各异,生成内容的高层特征表示在体系结构之间展现出对齐。基于此,我们提出了体系结构无关的目标导向特征协同(ATFS)框架。通过引入目标引导图像,ATFS 将多模型防御重构为统一的特征空间对齐任务,实现梯度的内在对齐,无需复杂的校正。大量实验表明,ATFS 在异构场景(如扩散模型+GAN)下实现了SOTA防御效果。该框架在40次迭代内即可收敛至90%以上的性能,面对紧张扰动预算仍保持强大的攻击鲁棒性。该框架通过切换特征提取器即可无缝扩展至未见体系结构(如 VQ-VAE),并对 JPEG 压缩和缩放具有稳健的抗干扰能力。ATFS 计算高效轻量,为破除防御孤岛、实现通用生成安全提供了可行路径。代码和模型已开源以便复现。
引用
@article{arxiv.2603.14860,
title = {Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats},
author = {Bingxue Zhang and Yang Gao and Feida Zhu and Yanyan Shen and Yang Shi},
journal= {arXiv preprint arXiv:2603.14860},
year = {2026}
}
备注
9 pages, 10 figures