面向零样本构图图像检索的联合视觉语言空间生成式编辑
计算机视觉与模式识别
2025-12-02 v1
摘要
构图图像检索(CIR)通过将参考图像与文本修改相结合,实现细粒度视觉搜索。虽然监督式CIR方法取得高准确率,但其依赖昂贵的三元组标注数据,激发了零样本解决方案的需求。零样本CIR(ZS-CIR)的核心挑战在于:现有文本导向或扩散式方法难以有效弥合视觉语言模态间的鸿沟。为此,我们提出Fusion-Diff,一个具有高效能和数据效率的新型生成式编辑框架,专为多模态对齐设计。首先,它引入联合视觉语言(VL)空间中的多模态融合特征编辑策略,显著缩小模态间的差距。其次,为最大化数据效率,框架集成轻量级Control-Adapter,通过仅在20万样本的有限规模合成数据集上进行微调,即可实现最先进的性能。在标准CIR基准测试(CIRR、FashionIQ和CIRCO)上的大量实验表明,Fusion-Diff显著优于之前的零样本方法。我们进一步通过可视化融合后的多模态表示,增强了模型的可解释性。
引用
@article{arxiv.2512.01636,
title = {Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval},
author = {Xin Wang and Haipeng Zhang and Mang Li and Zhaohui Xia and Yueguo Chen and Yu Zhang and Chunyu Wei},
journal= {arXiv preprint arXiv:2512.01636},
year = {2025}
}