FIRE-CIR:用于组合时尚图像检索的细粒度推理
计算机视觉与模式识别
2026-04-13 v1 机器学习
摘要
组合图像检索 (CIR) 旨在检索描绘参考图像经文本描述修改后的目标图像。虽然最近的视觉-语言模型 (VLM) 通过将图像和文本嵌入到共享空间中进行检索,实现了令人期待的 CIR 性能,但它们往往无法就该保留什么、该更改什么进行推理。这种限制阻碍了可解释性,并在如时尚等细粒度领域中导致次优结果。本文引入 FIRE-CIR,一种将组合推理和可解释性带入时尚 CIR 的模型。与仅依赖嵌入相似性不同,FIRE-CIR 执行以问题为导向的视觉推理:它自动从修改文本中生成面向属性的视觉问题,并在参考图像和候选图像中验证相应的视觉证据。为了训练此类推理系统,我们自动构建了一个大型时尚专用视觉问答数据集,包含需要单图像或双图像分析的问句。在检索过程中,我们的模型利用这种显式推理对候选结果进行重新排序,过滤掉与预期修改不一致的图像。在时尚 IQ基准测试上的实验结果表明,FIRE-CIR 在检索准确性方面优于最先进的方法。它还提供了关于检索决策的可解释、属性级别的见解。
引用
@article{arxiv.2604.09114,
title = {FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval},
author = {François Gardères and Camille-Sovanneary Gauthier and Jean Ponce and Shizhe Chen},
journal= {arXiv preprint arXiv:2604.09114},
year = {2026}
}