RedCaps:由大众创建、为大众服务的网络策展图像-文本数据
计算机视觉与模式识别
2021-11-23 v1 计算与语言
摘要
配对的大规模图像与文本数据集已日益流行,用于学习视觉及视觉-语言任务的通用表示。此类数据集通过查询搜索引擎或收集HTML替代文本构建——由于网络数据含有噪声,它们需要复杂的过滤流程以维持质量。我们探索了替代数据源,以最少的过滤收集高质量数据。我们引入了RedCaps——一个从Reddit收集的1200万图像-文本对的大规模数据集。来自Reddit的图像和标题描绘并描述了各种各样的物体和场景。我们从一个人工策展的subreddit集合中收集数据,其提供粗粒度图像标签并允许我们在不标注单个实例的情况下引导数据集构成。我们展示了在RedCaps上训练的 captioning 模型生成了丰富且多样的、受人类偏好的标题,并学习了可迁移到许多下游任务的视觉表示。
引用
@article{arxiv.2111.11431,
title = {RedCaps: web-curated image-text data created by the people, for the people},
author = {Karan Desai and Gaurav Kaul and Zubin Aysola and Justin Johnson},
journal= {arXiv preprint arXiv:2111.11431},
year = {2021}
}
备注
NeurIPS 2021 Datasets and Benchmarks. Website: https://redcaps.xyz