FashionFAE:基于细粒度属性的时尚领域视觉语言预训练
计算机视觉与模式识别
2025-01-14 v2
摘要
大规模视觉语言预训练(VLP)在通用领域已展现出显著的成功,但在时尚领域,物品主要依据纹理和材料等细粒度属性进行区分,这些属性对于检索等任务至关重要。现有模型往往无法充分利用来自文本和图像模态的细粒度属性。为此,我们提出了一种针对时尚领域的新方法:细粒度属性增强视觉语言预训练(FashionFAE),其关注时尚数据的细节特征。提出了属性强化文本预测任务,用于预测物品的细粒度属性,从而迫使模型聚焦于文本模态中的关键属性。此外,还提出了一种属性促进的图像重建任务,通过利用图像模态中的关键属性进一步提升模型的细粒度能力。大量实验表明,FashionFAE 在子测试集和完整测试集上的检索性能分别提升了 2.9% 和 5.2%,在识别任务中实现了 1.6% 的平均提升。
引用
@article{arxiv.2412.19997,
title = {FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training},
author = {Jiale Huang and Dehong Gao and Jinxia Zhang and Zechao Zhan and Yang Hu and Xin Wang},
journal= {arXiv preprint arXiv:2412.19997},
year = {2025}
}
备注
5 pages, Accepted by ICASSP2025, full paper