中文

Retail-786k:用于视觉实体匹配的大规模数据集

计算机视觉与模式识别 2024-03-12 v2

摘要

实体匹配(EM)定义为通过学习将语义概念从示例组(=实体)迁移至未见过数据来分组对象的任务。尽管许多 EM 问题背景下图像数据普遍可用,现有大多数 EM 算法仅依赖(文本)元数据。本文引入首个公开可用的大规模“视觉实体匹配”数据集,基于零售领域生产级用例。利用多年从不同欧洲零售商收集的广告传单扫描件,我们提供总计约 786k 张手动标注高分辨率产品图像,含约 18k 个不同零售产品,归为约 3k 实体。这些产品实体标注基于价格比较任务,每实体构成可比产品的等价类。初步基线评估表明,所提“视觉实体匹配”构成一种新学习问题,标准基于图像的分类与检索算法不足以解决。相反,需要能将基于示例的视觉等价类迁移到新数据的新型方法。本文旨在为此类算法提供基准。数据集信息、评估代码与下载说明见 https://www.retail-786k.org/。

关键词

引用

@article{arxiv.2309.17164,
  title  = {Retail-786k: a Large-Scale Dataset for Visual Entity Matching},
  author = {Bianca Lamm and Janis Keuper},
  journal= {arXiv preprint arXiv:2309.17164},
  year   = {2024}
}