中文

FashionFAE:基于细粒度属性的时尚领域视觉语言预训练

计算机视觉与模式识别 2025-01-14 v2

摘要

大规模视觉语言预训练(VLP)在通用领域已展现出显著的成功,但在时尚领域,物品主要依据纹理和材料等细粒度属性进行区分,这些属性对于检索等任务至关重要。现有模型往往无法充分利用来自文本和图像模态的细粒度属性。为此,我们提出了一种针对时尚领域的新方法:细粒度属性增强视觉语言预训练(FashionFAE),其关注时尚数据的细节特征。提出了属性强化文本预测任务,用于预测物品的细粒度属性,从而迫使模型聚焦于文本模态中的关键属性。此外,还提出了一种属性促进的图像重建任务,通过利用图像模态中的关键属性进一步提升模型的细粒度能力。大量实验表明,FashionFAE 在子测试集和完整测试集上的检索性能分别提升了 2.9% 和 5.2%,在识别任务中实现了 1.6% 的平均提升。

关键词

引用

@article{arxiv.2412.19997,
  title  = {FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training},
  author = {Jiale Huang and Dehong Gao and Jinxia Zhang and Zechao Zhan and Yang Hu and Xin Wang},
  journal= {arXiv preprint arXiv:2412.19997},
  year   = {2025}
}

备注

5 pages, Accepted by ICASSP2025, full paper