中文

面向文本到图像检索的剧情少样适应(EFSA)

计算机视觉与模式识别 2025-10-10 v3

摘要

文本到图像检索是管理多样化视觉内容的关键任务,但常见的基准数据集规模小且单一,难以反映现实世界的复杂性。预训练的视觉语言模型在处理容易的负样本时表现良好,但在处理硬负样本——视觉上相似却不正确的图像——时尤其在开放域场景中受限。为此,我们提出了剧情少样适应(EFSA)——一种新的测试时框架,通过对查询域进行动态适应来微调预训练模型——在 top-k 检索到的候选图像及其为其生成的合成标题上进行微调。EFSA 在 diverse domains 之间改善了性能,同时保持了泛化能力。我们在来自八个高度不同视觉 domain 的查询以及来自超过一百万图像的开放域检索池中进行评估。我们的工作凸显了剧情少样适应在这一关键且少见的开放域文本到图像检索任务中提升鲁棒性的潜力。

关键词

引用

@article{arxiv.2412.00139,
  title  = {EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval},
  author = {Muhammad Huzaifa and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2412.00139},
  year   = {2025}
}