中文

跨模态检索遇见推理:以跨模态检索改进零样本分类

计算机视觉与模式识别 2023-08-30 v1

摘要

对比语言-图像预训练(CLIP)已展现出卓越的零样本分类能力,即使用新颖文本标签进行图像分类。现有工作试图通过在下游任务上微调来增强 CLIP,但这无意中导致未见类上的性能下降,从而损害零样本泛化。本文旨在利用外部数据集中易得的图像-文本对,在推理时提供跨模态引导,以应对该挑战。为此,我们提出 X-MoRe,一种包含两个关键步骤的新型推理方法:(1) 跨模态检索与 (2) 基于模态置信度的集成。给定查询图像,我们利用 CLIP 的跨模态表示能力从外部图像-文本对数据集中检索相关文本信息。随后,我们为原始查询图像与检索文本中更可靠的模态分配更高权重,以贡献于最终预测。X-MoRe 在多样化任务上展现出稳健性能,且无需额外训练,证明了利用跨模态特征最大化 CLIP 零样本能力的有效性。

关键词

引用

@article{arxiv.2308.15273,
  title  = {Cross-Modal Retrieval Meets Inference:Improving Zero-Shot Classification with Cross-Modal Retrieval},
  author = {Seongha Eom and Namgyu Ho and Jaehoon Oh and Se-Young Yun},
  journal= {arXiv preprint arXiv:2308.15273},
  year   = {2023}
}