中文

单一枢纽文本即可攻破 CLIP:通过枢纽性识别跨模态编码器的脆弱性

计算与语言 2026-05-01 v1 人工智能 密码学与安全 信息检索

摘要

枢纽性问题,即枢纽嵌入与许多不相关的示例接近,经常出现在高维嵌入空间中,并可能对信息检索和自动评估指标等应用构成实际威胁。特别是,由于文本和图像之间的跨模态相似性无法通过字符串匹配等直接比较来计算,将不同模态投影到共享空间的跨模态编码器对于各种跨模态应用至关重要,因此,枢纽的存在可能带来实际威胁。为了揭示跨模态编码器的脆弱性,我们提出了一种识别枢纽嵌入及其对应枢纽文本的方法。在 MSCOCO 和 nocaps 上的图像描述评估以及 MSCOCO 和 Flickr30k 上的图像到文本检索任务中的实验表明,我们的方法能够识别出单个枢纽文本,该文本在许多图像上不合理地获得了与人类撰写的参考描述相当或更高的相似度分数,从而揭示了跨模态编码器的脆弱性。

关键词

引用

@article{arxiv.2604.27674,
  title  = {One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness},
  author = {Hiroyuki Deguchi and Katsuki Chousa and Yusuke Sakai},
  journal= {arXiv preprint arXiv:2604.27674},
  year   = {2026}
}

备注

Accepted at ACL2026 (main)