中文

SeMoBridge:用于 CLIP 高效少样本自适应的语义模态桥

计算机视觉与模式识别 2026-04-10 v3 人工智能 机器学习

摘要

尽管对比语言-图像预训练 (CLIP) 通过对齐图像和文本嵌入在零样本任务中表现出色,但其在少样本分类中的性能受到一个关键限制的阻碍:模态内不对齐。这一问题由持续的模态鸿沟和 CLIP 完全基于模态间的训练目标所导致,使得嵌入空间未校准,从而导致直接的图像到图像比较不可靠。现有方法试图通过细化相似度 logits 或通过计算代价高昂的逐样本优化来解决此问题。为了克服这些挑战,我们引入了 SeMoBridge,这是一种轻量但强大的方法,直接解决了不对齐问题。我们的方法将图像映射到文本模态,同时通过我们所谓的语义模态桥保持其语义内容不变。SeMoBridge 具有闭式解,并可选择通过多模态监督进行训练,结合图像和文本对齐损失来优化投影。实验表明,训练后的版本 SeMoBridge-T 仅需一小部分训练时间,且总体上优于其他方法,特别是在低数据场景(1, 2 和 4 shots)中。代码可在 https://github.com/christti98/semobridge 获取。

关键词

引用

@article{arxiv.2509.26036,
  title  = {SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP},
  author = {Christoph Timmermann and Hyunse Lee and Woojin Lee},
  journal= {arXiv preprint arXiv:2509.26036},
  year   = {2026}
}

备注

22 pages, 12 figures