中文

I0T:面向零模态差的嵌入标准化方法

机器学习 2024-12-20 v1 人工智能 计算机视觉与模式识别

摘要

对比语言-图像预训练(CLIP)使下游任务如图像-文本检索和分类实现零样本推理。然而,最近的扩展CLIP的工作因图像和文本嵌入投影到不同流形而产生模态差问题,偏离图像-文本对比学习的原意。我们发现这一现象与每个图像/文本编码器独立拥有的模态特定特征相关,提出两种方法解决模态差:(1)一种后处理嵌入标准化方法,I0Tpost\text{I0T}_{\text{post}}将模态差大致降至零;(2)一种可训练方法,I0Tasync\text{I0T}_{\text{async}}通过为每个编码器添加两个归一化层来缓解模态差问题。我们的I0T框架能够显著降低模态差,同时保留训练模型的原始嵌入表示。实际中,I0Tpost\text{I0T}_{\text{post}}可作为广泛使用的CLIPScore(CLIP-S)的可解释的自动评估指标。

关键词

引用

@article{arxiv.2412.14384,
  title  = {I0T: Embedding Standardization Method Towards Zero Modality Gap},
  author = {Na Min An and Eunki Kim and James Thorne and Hyunjung Shim},
  journal= {arXiv preprint arXiv:2412.14384},
  year   = {2024}
}

备注

16 figures, 8 figures, 7 tables