V$^2$L:将视觉模型与视觉-语言模型引入大规模商品检索
计算机视觉与模式识别
2022-07-27 v1
摘要
商品检索在电子商务领域具有重要意义。本文介绍了我们在 eBay eProduct Visual Search Challenge (FGVC9) 中获得第一名的方案,其特点在于集成了约 20 个来自视觉模型与视觉-语言模型的模型。尽管模型集成十分常见,我们表明结合视觉模型与视觉-语言模型能带来源于二者互补性的特殊收益,是我们取得优势的关键因素。具体而言,对于视觉模型,我们采用两阶段训练流程:首先从训练集提供的粗粒度标签中学习,再进行细粒度自监督训练,从而形成由粗到细的度量学习范式。对于视觉-语言模型,我们利用训练图像的文字描述作为监督信号来微调图像编码器(特征提取器)。借助这些设计,我们的方案取得了 0.7623 的 MAR@10,在所有参赛队伍中排名第一。代码见:\href{https://github.com/WangWenhao0716/V2L}{VL}。
引用
@article{arxiv.2207.12994,
title = {V$^2$L: Leveraging Vision and Vision-language Models into Large-scale Product Retrieval},
author = {Wenhao Wang and Yifan Sun and Zongxin Yang and Yi Yang},
journal= {arXiv preprint arXiv:2207.12994},
year = {2022}
}
备注
CVPR FGVC9 eBay eProduct Visual Search Challenge Rank 1st solution