MMFL-Net:用于跨域时尚检索的多尺度多粒度特征学习
计算机视觉与模式识别
2022-10-28 v1 人工智能
摘要
时尚领域的实例级图像检索因其在真实场景视觉时尚搜索中日益增长的重要性而成为一个具有挑战性的问题。跨域时尚检索旨在将不受约束的顾客图像作为查询,与零售商提供的照片进行匹配;然而,由于消费者到商店(C2S)之间存在广泛的域差异,并且考虑到服装图像易受各种非刚性形变的影响,这是一项困难的任务。为此,我们提出了一种新颖的多尺度多粒度特征学习网络(MMFL-Net),该网络可以在一个统一的框架中联合学习服装图像的全局-局部聚合特征表示,旨在训练一个用于C2S时尚视觉相似性的跨域模型。首先,设计了一个新的语义-空间特征融合部分,通过应用自上而下和自下而上的双向多尺度特征融合来弥合语义-空间鸿沟。其次,引入了一种多分支深度网络架构,以捕获全局显著性、部件信息和局部细节信息,并通过将粗到细嵌入的相似性学习与多粒度相结合,提取鲁棒且有判别力的特征嵌入。最后,我们的MMFL-Net采用了改进的三元组损失、中心损失和多任务分类损失,这些损失可以联合优化类内和类间距离,从而显式地改善其特征表示在特征学习中的类内紧凑性和类间判别性。此外,我们提出的模型还将多任务属性识别和分类模块与多标签语义属性和产品ID标签相结合。实验结果表明,我们提出的MMFL-Net在两个数据集DeepFashion-C2S和Street2Shop上均取得了优于现有方法的显著提升。
引用
@article{arxiv.2210.15128,
title = {MMFL-Net: Multi-scale and Multi-granularity Feature Learning for Cross-domain Fashion Retrieval},
author = {Chen Bao and Xudong Zhang and Jiazhou Chen and Yongwei Miao},
journal= {arXiv preprint arXiv:2210.15128},
year = {2022}
}
备注
27 pages, 12 figures, Published by <Multimedia Tools and Applications>