CLIP 文本编码器的脆弱性分析
多媒体
2025-11-10 v2 人工智能
信息检索
摘要
多模态嵌入模型,尤其是 CLIP,近年来通过在共享表示空间中对齐图像和文本,推动了零样本分类和多媒体信息检索领域的技术进步。然而,这类在对比式对齐上训练的模型对小输入扰动不够稳定。尤其是在处理手动表达的查询时,查询的微小变更会导致最佳匹配结果的排名发生大幅变化。本文系统性地分析了在多媒体信息检索场景中,多类非语义查询扰动的效果。我们在多个 CLIP 变体上评估了多样化的词法、句法和语义扰动,采用 TRECVID Ad-Hoc 视频搜索查询和 V3C1 视频集合。跨模型而言,句法和语义扰动驱动最大的不稳定性,而脆弱性集中在如此表面编辑(如标点和大小写)之类 trivial 的表面修改中。我们的结果表明,鲁棒性是评估视觉-语言模型时,超越基准准确性的关键维度。
引用
@article{arxiv.2511.04247,
title = {On the Brittleness of CLIP Text Encoders},
author = {Allie Tran and Luca Rossetto},
journal= {arXiv preprint arXiv:2511.04247},
year = {2025}
}
备注
Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness