IsoCLIP:分解 CLIP 投影器以实现高效类内对齐
计算机视觉与模式识别
2026-03-23 v1 机器学习
摘要
视觉语言模型如 CLIP 广泛用于涉及视觉与文本两种模态的跨模态任务。然而,当对单个模态的编码器应用于图像-图像检索等固有类内任务时,其性能会因类内错位而受到影响。本文聚焦于 CLIP 中类内错位的研究,特别考察将预投影后的图像和文本嵌入映射到共享嵌入空间的投影器的作用。通过分析应用于投影特征的余弦相似度形式及其与对比式 CLIP 损失的相互作用,我们指出存在一个跨模态算子在训练期间负责对两种模态进行对齐,而第二个算子仅执行类内归一化,却不促进类内对齐。通过对跨模态算子的谱分析,我们识别出两种模态良好对齐的近各向同性子空间,以及特定于每种模态的各向异性方向。我们展示,该对齐子空间可直接从投影器权重中获得,去除各向异性方向后可改善类内对齐。我们的实验在类内检索和分类基准测试中表明,本训练-free 方法显著降低类内错位,大幅降低延迟,并在多个预训练 CLIP 类模型中超越现有方法。代码已公开:https://github.com/simomagi/IsoCLIP。
引用
@article{arxiv.2603.19862,
title = {IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment},
author = {Simone Magistri and Dipam Goswami and Marco Mistretta and Bartłomiej Twardowski and Joost van de Weijer and Andrew D. Bagdanov},
journal= {arXiv preprint arXiv:2603.19862},
year = {2026}
}
备注
Accepted at CVPR2026