FashionSearchNet-v2:基于定位学习属性表示以实现属性操控的图像检索
计算机视觉与模式识别
2021-11-30 v1 人工智能
摘要
本文关注属性操控下的图像检索问题。我们提出的方法能够操控查询图像中期望的属性,同时保持其其他属性。例如,可将查询图像的领子属性从圆领改为 V 领,从而从大型数据集中检索相似图像。电子商务中的一个关键挑战是图像具有多个用户希望操控的属性,并且为每个属性估计有区分性的特征表示十分重要。所提出的 FashionSearchNet-v2 架构能够通过其弱监督定位模块学习特定于属性的表示,该模块在特征空间中忽略与属性无关的特征,从而改进相似性学习。该网络通过属性分类与三元组排序损失的组合进行联合训练以估计局部表示。然后,这些局部表示基于所指示的属性操控合并为单一的全局表示,从而可通过距离度量检索期望的图像。所提方法还为其检索过程提供可解释性,以帮助提供关于网络注意力的额外信息。在多个属性数量丰富的数据集上进行的实验表明,FashionSearchNet-v2 优于其他最先进(SOTA)的属性操控技术。与我们早期的工作(FashionSearchNet)不同,我们在学习过程中提出了若干改进,并表明所提出的 FashionSearchNet-v2 可推广到时尚以外的不同领域。
引用
@article{arxiv.2111.14145,
title = {FashionSearchNet-v2: Learning Attribute Representations with Localization for Image Retrieval with Attribute Manipulation},
author = {Kenan E. Ak and Joo Hwee Lim and Ying Sun and Jo Yew Tham and Ashraf A. Kassim},
journal= {arXiv preprint arXiv:2111.14145},
year = {2021}
}
备注
15 pages