视觉-语言基础模型中的等变相似性
计算机视觉与模式识别
2023-10-10 v2
摘要
本研究探讨了视觉-语言基础模型(VLMs)中的等变(equivariance)概念,特别关注多模态相似性函数——它不仅是主要的训练目标,也是支撑下游任务的核心输出。现有的图像-文本相似性目标仅将匹配对归类为相似、未匹配对为不相似,而等变性还要求相似性能够忠实于语义变化而相应改变。这使得 VLMs 能更好地泛化到细微且未见过的多模态组合。然而,对等变性建模具有挑战性,因为语义变化的真实标签难以收集。例如,给定一对关于狗的图像-文本,当像素从狗变为猫时,相似性在多大程度上发生变化是不明确的?为此,我们提出 EqSim,一种正则化损失,可从任意两个匹配的训练对中高效计算,并易于插入现有的图像-文本检索微调中。同时,为了进一步诊断 VLMs 的等变性,我们提出了一个新的具有挑战性的基准 EqBen。与现有评测集相比,EqBen 首个聚焦于“视觉最小变化”。大量实验表明当前 VLMs 缺乏等变性,并验证了 EqSim 的有效性。代码见 https://github.com/Wangt-CN/EqBen。
引用
@article{arxiv.2303.14465,
title = {Equivariant Similarity for Vision-Language Foundation Models},
author = {Tan Wang and Kevin Lin and Linjie Li and Chung-Ching Lin and Zhengyuan Yang and Hanwang Zhang and Zicheng Liu and Lijuan Wang},
journal= {arXiv preprint arXiv:2303.14465},
year = {2023}
}
备注
Accepted by ICCV'23 (Oral); Add evaluation on MLLM