多模态模型中文本图像对齐误差的安全风险
计算机视觉与模式识别
2025-10-31 v1 人工智能
密码学与安全
摘要
尽管多模态扩散模型(如文本到图像模型)在进步与多功能性方面取得了显著成就,但其对对抗输入的敏感性仍未得到充分探讨。与预期相反,我们的调查发现,现有扩散模型中文本与图像模态的对齐程度不足。这一不对齐现象在生成不适或不适合工作场所 (NSFW) 内容时尤其具有显著风险。为此,我们提出一种新型攻击,称为受限提示多模态攻击 (Prompt-Restricted Multi-modal Attack, PReMA),通过修改输入图像并结合任意指定提示(而不改变提示本身)来操控生成内容。PReMA 是首个仅通过创建对抗图像来操控模型输出的攻击,区别于以主要生成对抗提示以产生 NSFW 内容的先前方法。因此,PReMA 对多模态扩散模型构成新的威胁,尤其是在使用固定提示的图像编辑应用中。对图像 inpainting 和风格迁移任务进行的全面评估表明,PReMA 在各种模型上具有强大的有效性。
引用
@article{arxiv.2510.26105,
title = {Security Risk of Misalignment between Text and Image in Multi-modal Model},
author = {Xiaosen Wang and Zhijin Ge and Shaokang Wang},
journal= {arXiv preprint arXiv:2510.26105},
year = {2025}
}