少样本文本到图像检索:新基准数据集与优化方法
计算机视觉与模式识别
2026-03-30 v1
摘要
预训练的视觉-语言模型(VLMs)在多模态任务中表现出色,通常将图像编码为嵌入向量并存储在数据库中,通过近似最近邻搜索(ANNS)进行检索。然而,这些模型在组合查询和分布外(OOD)图像-文本对上表现不佳。借鉴人类从少量示例中学习的能力,我们通过专门针对图像检索的少样本学习方法来解决这一性能差距。我们引入了少样本文本到图像检索(FSIR)任务及其配套的基准数据集 FSIR-BD——这是第一个明确针对带有参考示例的文本图像检索的基准,重点关注具有挑战性的组合查询和 OOD 查询。组合部分分为城市场景和自然物种,两者均具有特定情境或独特特征。FSIR-BD 包含 38,353 张图像和 303 个查询,其中 82% 构成测试语料库(每个查询平均 37 个正样本、真实匹配和大量困难负样本),18% 构成少样本参考语料库(FSR),包含示例正样本和困难负样本图像。此外,我们提出了两种新颖的检索优化方法,利用 FSR 中的单样本或少样本参考示例来提升性能。两种方法均与任何预训练图像编码器兼容,可应用于现有的大规模环境。我们的实验表明:(1)FSIR-BD 为图像检索提供了具有挑战性的基准;(2)我们的优化方法在平均精度均值(mAP)指标上优于现有基线。对 FSIR 优化方法的进一步研究将有助于缩小机器与人类水平理解之间的差距,特别是在从有限示例进行组合推理方面。
引用
@article{arxiv.2603.25891,
title = {Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods},
author = {Ofer Idan and Vladi Vexler and Gil Lederman and Dima Sivov and Aviad Cohen Zada and Shir Niego Komforti},
journal= {arXiv preprint arXiv:2603.25891},
year = {2026}
}