全方位去对齐:或将任意文本对齐到多模态模型中的任意图像
计算机视觉与模式识别
2024-07-02 v1 人工智能
计算与语言
机器学习
摘要
利用共享嵌入空间,新兴的多模态模型展现出前所未有的零样学习能力。然而,共享嵌入空间可能导致不同模态错位,从而引入新漏洞。本文扩展并利用一种最近开发的有效基于梯度的程序,允许我们通过最小修改图像来匹配给定文本的嵌入。使用该程序,我们展示了可以通过几乎察觉不出的对抗性攻击将可辨认的文本嵌入对齐到任何图像,从而揭示了语义上无关的图像可能具有相同的文本嵌入,同时视觉上几乎无差别的图像可能匹配到非常不同的文本的嵌入。我们的技术在应用于文本数据集和来自多个来源的图像时实现了100%的成功率。在未克服此漏洞之前,多模态模型无法以语义上有意义的方式稳健地对来自不同模态的输入进行对齐。\textbf{警告:本文中使用的文本数据具有毒性,可能对某些读者造成冒犯。}
引用
@article{arxiv.2407.01157,
title = {Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models},
author = {Shaeke Salman and Md Montasir Bin Shams and Xiuwen Liu},
journal= {arXiv preprint arXiv:2407.01157},
year = {2024}
}
备注
14 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2401.15568, arXiv:2402.08473