多模态嵌入中的对抗幻象
密码学与安全
2025-08-26 v5 人工智能
机器学习
摘要
多模态嵌入将文本、图像、热成像、声音与视频编码至单一嵌入空间,使不同模态的表示对齐(例如将狗的图像与吠声关联)。本文表明,多模态嵌入可能易受一种我们称为“对抗幻象”的攻击。给定一幅图像或一段声音,攻击者可对其施加扰动,使其嵌入接近另一模态中由攻击者任意选定的输入。这些攻击是跨模态且定向的:攻击者可将任意图像或声音与其所选的任何目标对齐。对抗幻象利用嵌入空间中的邻近性,因而与下游任务及模态无关,能够对当前与未来任务以及攻击者不可得的模态造成整体性破坏。利用 ImageBind 与 AudioCLIP 嵌入,我们展示了在不知晓具体下游任务情况下生成的对抗对齐输入如何误导图像生成、文本生成、零样本分类与音频检索。我们研究了幻象在不同嵌入间的可迁移性,并开发了方法的黑盒版本,借此展示了对亚马逊商用专有 Titan 嵌入的首次对抗对齐攻击。最后,我们分析了对策与规避攻击。
引用
@article{arxiv.2308.11804,
title = {Adversarial Illusions in Multi-Modal Embeddings},
author = {Tingwei Zhang and Rishi Jha and Eugene Bagdasaryan and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2308.11804},
year = {2025}
}
备注
In USENIX Security'24