双注意力引导的防御机制:对抗性编辑的有效抵御
计算机视觉与模式识别
2025-12-17 v1 人工智能
计算机与社会
机器学习
摘要
最近的文本到图像扩散模型进展不断推动通过文本提示进行图像编辑,但这也带来了针对性滥用创建误导性或有害内容的伦理挑战。虽然当前的防御机制通过嵌入难以察觉的扰动来缓解此风险,但其效果在面对恶意篡改时仍有限。为此,我们提出了一种双注意力引导的噪声扰动(DANP)免疫方法,通过添加难以察觉的扰动来干扰模型的语义理解与生成过程。DANP 跨越多个时间步,对交叉注意力图和噪声预测过程进行操作,使用动态阈值生成掩码,以识别文本相关与不相关区域。随后,它在相关区域减少注意力,增加不相关区域的注意力,从而误导编辑朝向错误区域,并保留原有目标。此外,我们的方法最大化注入噪声与模型预测噪声之间的差异,以进一步干扰生成过程。通过同时针对注意力和噪声预测机制,DANP 在抵御恶意编辑方面表现出色,广泛实验结果也证明该方法实现了最佳性能。
引用
@article{arxiv.2512.14333,
title = {Dual Attention Guided Defense Against Malicious Edits},
author = {Jie Zhang and Shuai Dong and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2512.14333},
year = {2025}
}
备注
11 pages, 7 figures