FACap:大规模时尚数据集用于细粒度组合图像检索
机器学习
2025-07-11 v1
摘要
组合图像检索(CIR)任务是指根据参考图像和修改文本检索目标图像。近期方法利用大型预训练视觉语言模型(VLM)在诸如颜色和纹理等通用领域概念上取得良好性能。然而,时尚等应用领域仍受挑战,因为时尚领域使用的丰富且多样的词汇需要特定的细粒度视觉和语言理解。此外,由于专业人员的人工标注成本高昂,缺乏带有详细且相关标注的大型时尚数据集。为此,我们引入 FACap,一个大规模、自动构建的时尚领域 CIR 数据集。该数据集利用网络来源的时尚图片,结合由 VLM 和大语言模型(LLM)驱动的两阶段标注流程,生成准确且详尽的修改文本。随后,我们提出一种新的 CIR 模型FashionBLIP-2,通过轻量化适配器和多头查询-候选匹配,对通用领域的 BLIP-2 模型在 FACap 上的微调,以更好地考虑时尚特定信息的细粒度。FashionBLIP-2 在Fashion IQ基准和增强版评估数据集 enhFashionIQ 上进行评估,分别在无和有额外微调的情况下。实验结果表明,FashionBLIP-2 与 FACap 预训练的组合在尤其是处理细粒度修改文本的检索方面显著提升模型性能,展示了在电商网站等高度挑战性环境中该数据集和方法的价值。代码已公开:https://fgxaos.github.io/facap-paper-website/。
引用
@article{arxiv.2507.07135,
title = {FACap: A Large-scale Fashion Dataset for Fine-grained Composed Image Retrieval},
author = {François Gardères and Shizhe Chen and Camille-Sovanneary Gauthier and Jean Ponce},
journal= {arXiv preprint arXiv:2507.07135},
year = {2025}
}