中文

用于组合图像检索的文本编码器任务差异的高效事后框架

计算机视觉与模式识别 2025-03-19 v2 信息检索

摘要

组合图像检索(CIR)旨在基于参考图像和条件文本检索目标图像,实现可控图像搜索。主流的零样图(ZS)CIR 方法通过将图像嵌入投射到文本标记嵌入空间中,形成用于检索的组合查询,从而绕开昂贵的训练 CIR 三元组。然而,我们指出这些投射式 CIR 方法存在固有的局限性:文本编码器在原始预训练任务(文本 \leftrightarrow 图像)与目标 CIR 任务(图像 + 文本 \leftrightarrow 图像)之间的任务差异,这可能对 CIR 性能产生负面影响。为减少此类差异,直观的解决方案是使用 CIR 三元组以监督方式训练图像和文本编码器。相反,我们引入减少文本编码器任务差异(RTD),一个高效的文本-only 事后框架,用于补充投射式 CIR 方法。我们设计了一种以目标锚定文本对比学习,以增强文本编码器的 CIR 能力。我们还提出了两个关键改进:(1) 基于硬负样本的精炼批采样策略和 (2) 精炼的拼接方案,以进一步缓解训练-推理差异。将 RTD 集成到最先进的投射式方法中,仅需在 4 张 A100 GPU 上额外训练 23 分钟,即可实现与或甚至超过资源密集型最先进的基于人造 CIR 三元组的方法相当的性能(训练速度提升最高可达 100×100\times)。我们的代码将在接受后提供。

关键词

引用

@article{arxiv.2406.09188,
  title  = {An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval},
  author = {Jaeseok Byun and Seokhyeon Jeong and Wonjae Kim and Sanghyuk Chun and Taesup Moon},
  journal= {arXiv preprint arXiv:2406.09188},
  year   = {2025}
}

备注

22 pages