Retail-786k:用于视觉实体匹配的大规模数据集
计算机视觉与模式识别
2024-03-12 v2
摘要
实体匹配(EM)定义为通过学习将语义概念从示例组(=实体)迁移至未见过数据来分组对象的任务。尽管许多 EM 问题背景下图像数据普遍可用,现有大多数 EM 算法仅依赖(文本)元数据。本文引入首个公开可用的大规模“视觉实体匹配”数据集,基于零售领域生产级用例。利用多年从不同欧洲零售商收集的广告传单扫描件,我们提供总计约 786k 张手动标注高分辨率产品图像,含约 18k 个不同零售产品,归为约 3k 实体。这些产品实体标注基于价格比较任务,每实体构成可比产品的等价类。初步基线评估表明,所提“视觉实体匹配”构成一种新学习问题,标准基于图像的分类与检索算法不足以解决。相反,需要能将基于示例的视觉等价类迁移到新数据的新型方法。本文旨在为此类算法提供基准。数据集信息、评估代码与下载说明见 https://www.retail-786k.org/。
引用
@article{arxiv.2309.17164,
title = {Retail-786k: a Large-Scale Dataset for Visual Entity Matching},
author = {Bianca Lamm and Janis Keuper},
journal= {arXiv preprint arXiv:2309.17164},
year = {2024}
}