不仅仅是文本:揭示图像生成模型中视觉模态的排版威胁
计算机视觉与模式识别
2025-05-01 v2 性能
摘要
当前的图像生成模型可以轻松生成高质量、高度逼真的图像,但这也增加了误用的风险。在各种文本到图像或图像到图像任务中,攻击者只需编辑语言模态输入即可生成一系列包含不当内容的图像。为缓解这一安全问题,已提出多种防护或防御策略,特别强调保护语言模态。然而,在实际应用中,视觉模态中的威胁——特别是涉及编辑真实世界图像的任务——呈现出更高的安全风险,因为它们容易侵犯图像所有者的权利。因此,本文采用排版攻击的方法,揭示了各种图像生成模型同样容易受到视觉模态中的威胁。此外,我们还评估了各种现有方法在面对视觉模态威胁时的防御性能,并揭示了其无效性。最后,我们提出了图像生成模型中的视觉模态威胁(VMT-IGMs)数据集,作为评估各种图像生成模型视觉模态脆弱性的基准。
引用
@article{arxiv.2412.05538,
title = {Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models},
author = {Hao Cheng and Erjia Xiao and Jiayan Yang and Jiahang Cao and Qiang Zhang and Jize Zhang and Kaidi Xu and Jindong Gu and Renjing Xu},
journal= {arXiv preprint arXiv:2412.05538},
year = {2025}
}
备注
This paper is accept by CVPR2025 (https://cvpr.thecvf.com/virtual/2025/poster/34964)