中文

从像素到散文:一个大规模密集图像描述数据集

计算机视觉与模式识别 2024-06-18 v1 计算与语言 机器学习

摘要

训练大型视觉语言模型需要大量高质量的图像-文本对。然而,现有的网络抓取数据集噪声大且缺乏详细的图像描述。为了弥合这一差距,我们引入了PixelProse,这是一个包含超过1600万条合成生成描述的综合数据集,利用尖端的视觉语言模型进行详细和准确的描述。为了确保数据完整性,我们严格分析了数据集中存在的问题内容,包括儿童性虐待材料(CSAM)、个人身份信息(PII)和毒性。我们还提供了有价值的元数据,如水印存在性和美学评分,有助于进一步的数据集过滤。我们希望PixelProse能成为未来视觉语言研究的宝贵资源。PixelProse可在https://huggingface.co/datasets/tomg-group-umd/pixelprose获取。

关键词

引用

@article{arxiv.2406.10328,
  title  = {From Pixels to Prose: A Large Dataset of Dense Image Captions},
  author = {Vasu Singla and Kaiyu Yue and Sukriti Paul and Reza Shirkavand and Mayuka Jayawardhana and Alireza Ganjdanesh and Heng Huang and Abhinav Bhatele and Gowthami Somepalli and Tom Goldstein},
  journal= {arXiv preprint arXiv:2406.10328},
  year   = {2024}
}

备注

pixelprose 16M dataset