TINA: 针对已遗忘文本到图像扩散模型的无文本反转攻击
计算机视觉与模式识别
2026-03-19 v1
摘要
尽管文本到图像扩散模型展现出卓越的生成能力,但概念擦除技术对于其安全部署、防止有害内容生成至关重要。这促进了擦除防御与旨在绕过防御的对抗性探测之间的动态博弈,这种共同进化逐步提升了擦除方法的有效性。然而,这种对抗性共同进化已收敛于一个狭窄的、以文本为中心的范式,该范式将擦除等同于切断文本到图像的映射,忽略了与不良概念相关的底层视觉知识仍然存在。为证实这一论断,我们从视觉角度进行研究,利用DDIM反转来探测是否仍能找到通往已擦除概念的生成路径。然而,识别这样的视觉生成路径具有挑战性,因为标准的文本引导DDIM反转会受到已擦除模型中文本中心防御的主动抵抗。为解决此问题,我们引入了TINA,一种新颖的无文本反转攻击,它通过在空文本条件下运行来强制执行这种纯视觉探测,从而避开现有的文本中心防御。此外,TINA集成了一个优化过程,以克服标准反转在缺乏其通常文本引导时产生的累积近似误差。我们的实验表明,TINA能够从经过最先进遗忘技术处理的模型中重新生成已擦除的概念。TINA的成功证明,当前方法仅仅是掩盖了概念,凸显了迫切需要直接作用于内部视觉知识的范式。
引用
@article{arxiv.2603.17828,
title = {TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models},
author = {Qianlong Xiang and Miao Zhang and Haoyu Zhang and Kun Wang and Junhui Hou and Liqiang Nie},
journal= {arXiv preprint arXiv:2603.17828},
year = {2026}
}
备注
16 pages, accepted by CVPR 2026