面向组合图像检索的高质量三元组数据自动合成
计算机视觉与模式识别
2025-10-14 v3
摘要
组合图像检索(CIR)是一项具有挑战性的视觉-语言(VL)任务,旨在使用多模态(图像+文本)查询检索目标图像。虽然已有许多 CIR 方法取得了令人满意的性能,但其依赖高成本的人工标注三元组,限制了可扩展性和零样本能力。为此,我们提出一种可扩展的三元组自动生成流水线,以及一个名为 Composed Image Retrieval on High-quality Synthetic Triplets(CIRHS)的全合成数据集。该流水线利用大型语言模型(LLM)生成多样化提示词,控制文本到图像生成模型产出每对图像中元素相同的图像对,再经筛选和重组形成 CIRHS 数据集。此外,我们引入 Hybrid Contextual Alignment(CoAlign),一种新型 CIR 框架,能够在更广阔的上下文中实现全局对齐和局部推理,使模型能学习更稳健且信息丰富的表征。通过利用合成 CIRHS 数据集,CoAlign 在三个常用基准上实现了卓越的零样本性能,首次证明了在全合成数据集上训练 CIR 模型的可行性。在监督训练下,我们的方法超越了所有无监督 CIR 方法,验证了我们提出的检索框架的有效性。代码和 CIRHS 数据集将很快公开。
引用
@article{arxiv.2507.05970,
title = {Automatic Synthesis of High-Quality Triplet Data for Composed Image Retrieval},
author = {Haiwen Li and Delong Liu and Zhaohui Hou and Zhicheng Zhao and Fei Su},
journal= {arXiv preprint arXiv:2507.05970},
year = {2025}
}
备注
This paper was originally submitted to ACM MM 2025 on April 12, 2025