Product1M:通过跨模态预训练实现弱监督实例级商品检索
计算机视觉与模式识别
2021-08-10 v2
摘要
如今,顾客对电子商务的需求更加多样化,这给商品检索行业带来了更多复杂性。先前的方法要么受限于单模态输入,要么执行有监督的图像级商品检索,因而无法适应存在大量弱标注多模态数据的真实场景。在本文中,我们研究了一种更实际的设定,旨在细粒度商品类别中执行弱监督多模态实例级商品检索。为促进对这一挑战性任务的研究,我们贡献了 Product1M,它是用于真实世界实例级检索的最大多模态化妆品数据集之一。值得注意的是,Product1M 包含超过 100 万图像-文本对,并由两种样本类型组成,即单商品和多商品样本,涵盖了广泛的化妆品品牌。除高度多样性外,Product1M 还具有细粒度类别、复杂组合和模糊对应等若干吸引人的特性,很好地模拟了真实场景。此外,我们提出了一种名为跨模态对比商品 Transformer 用于实例级商品检索(CAPTURE)的新模型,它通过混合流 transformer 以自监督方式出色地捕捉多模态输入之间的潜在协同。CAPTURE 通过掩码多模态学习以及跨模态对比预训练生成判别性实例特征,并且优于若干 SOTA 跨模态基线。大量消融研究很好地证明了我们模型的有效性和泛化能力。数据集与代码可在 https: //github.com/zhanxlin/Product1M 获取。
引用
@article{arxiv.2107.14572,
title = {Product1M: Towards Weakly Supervised Instance-Level Product Retrieval via Cross-modal Pretraining},
author = {Xunlin Zhan and Yangxin Wu and Xiao Dong and Yunchao Wei and Minlong Lu and Yichi Zhang and Hang Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2107.14572},
year = {2021}
}