中文

eProduct:用于应对商品识别挑战的百万规模视觉搜索基准

计算机视觉与模式识别 2021-07-14 v1

摘要

大规模商品识别是计算机视觉与机器学习在电子商务领域的主要应用之一。由于商品数量通常远大于商品类别数,基于图像的商品识别常被视作视觉搜索而非分类问题。它也是超细粒度识别的一个实例,其中许多商品之间存在轻微或细微的视觉差异。在真实场景下为各类视觉搜索方案的训练与评估创建基准数据集一直是一项挑战。这促成了 eProduct 的创建,该数据集包含 250 万张商品图像,旨在推动自监督学习、弱监督学习和多模态学习在细粒度识别方面的发展。我们将 eProduct 呈现为训练集与评估集,其中训练集包含 130 万余张带标题和层级类别标签的刊登图像用于模型开发,评估集包含 10,000 张查询图像和 110 万张索引图像用于视觉搜索评估。我们将介绍 eProduct 的构建步骤,分析其多样性,并涵盖在其上训练的基线模型性能。

关键词

引用

@article{arxiv.2107.05856,
  title  = {eProduct: A Million-Scale Visual Search Benchmark to Address Product Recognition Challenges},
  author = {Jiangbo Yuan and An-Ti Chiang and Wen Tang and Antonio Haro},
  journal= {arXiv preprint arXiv:2107.05856},
  year   = {2021}
}

备注

This paper was accepted at FGVC8 CVPR2021 as a competition paper (https://sites.google.com/view/fgvc8/papers)