用于组合图像检索的文本编码器任务差异的高效事后框架
计算机视觉与模式识别
2025-03-19 v2 信息检索
摘要
组合图像检索(CIR)旨在基于参考图像和条件文本检索目标图像,实现可控图像搜索。主流的零样图(ZS)CIR 方法通过将图像嵌入投射到文本标记嵌入空间中,形成用于检索的组合查询,从而绕开昂贵的训练 CIR 三元组。然而,我们指出这些投射式 CIR 方法存在固有的局限性:文本编码器在原始预训练任务(文本 图像)与目标 CIR 任务(图像 + 文本 图像)之间的任务差异,这可能对 CIR 性能产生负面影响。为减少此类差异,直观的解决方案是使用 CIR 三元组以监督方式训练图像和文本编码器。相反,我们引入减少文本编码器任务差异(RTD),一个高效的文本-only 事后框架,用于补充投射式 CIR 方法。我们设计了一种以目标锚定文本对比学习,以增强文本编码器的 CIR 能力。我们还提出了两个关键改进:(1) 基于硬负样本的精炼批采样策略和 (2) 精炼的拼接方案,以进一步缓解训练-推理差异。将 RTD 集成到最先进的投射式方法中,仅需在 4 张 A100 GPU 上额外训练 23 分钟,即可实现与或甚至超过资源密集型最先进的基于人造 CIR 三元组的方法相当的性能(训练速度提升最高可达 )。我们的代码将在接受后提供。
引用
@article{arxiv.2406.09188,
title = {An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval},
author = {Jaeseok Byun and Seokhyeon Jeong and Wonjae Kim and Sanghyuk Chun and Taesup Moon},
journal= {arXiv preprint arXiv:2406.09188},
year = {2025}
}
备注
22 pages