Let's Go Shopping (LGS)——面向视觉概念理解的网络规模图像-文本数据集
计算机视觉与模式识别
2024-03-07 v2 人工智能
摘要
神经网络的视觉及视觉-语言应用(如图像分类与描述生成)依赖于大规模标注数据集,而这些数据集需要非平凡的数据收集过程。这一耗时的工作阻碍了大规模数据集的出现,使研究人员和从业者只能局限于少数选择。因此,我们寻求更高效的图像收集与标注方式。以往的尝试从HTML替代文本中收集描述,或从社交媒体帖子中爬取数据,但这些数据源存在噪声、稀疏性或主观性问题。为此,我们转向商业购物网站,其数据满足三个标准:清洁性、信息性和流畅性。我们推出了Let's Go Shopping (LGS)数据集,这是一个来自公开电子商务网站、包含1500万图像-描述对的大规模公开数据集。与现有的通用领域数据集相比,LGS图像聚焦于前景物体,背景复杂度较低。我们在LGS上的实验表明,在现有基准数据集上训练的分类器不能轻易泛化到电子商务数据,而特定的自监督视觉特征提取器则能更好地泛化。此外,LGS高质量的以电子商务为中心的图像及其双模态特性,使其在视觉-语言双模态任务中具有优势:LGS使图像描述生成模型能够生成更丰富的描述,并帮助文本到图像生成模型实现电子商务风格迁移。
引用
@article{arxiv.2401.04575,
title = {Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding},
author = {Yatong Bai and Utsav Garg and Apaar Shanker and Haoming Zhang and Samyak Parajuli and Erhan Bas and Isidora Filipovic and Amelia N. Chu and Eugenia D Fomitcheva and Elliot Branson and Aerin Kim and Somayeh Sojoudi and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2401.04575},
year = {2024}
}