从像素到散文:一个大规模密集图像描述数据集
计算机视觉与模式识别
2024-06-18 v1 计算与语言
机器学习
摘要
训练大型视觉语言模型需要大量高质量的图像-文本对。然而,现有的网络抓取数据集噪声大且缺乏详细的图像描述。为了弥合这一差距,我们引入了PixelProse,这是一个包含超过1600万条合成生成描述的综合数据集,利用尖端的视觉语言模型进行详细和准确的描述。为了确保数据完整性,我们严格分析了数据集中存在的问题内容,包括儿童性虐待材料(CSAM)、个人身份信息(PII)和毒性。我们还提供了有价值的元数据,如水印存在性和美学评分,有助于进一步的数据集过滤。我们希望PixelProse能成为未来视觉语言研究的宝贵资源。PixelProse可在https://huggingface.co/datasets/tomg-group-umd/pixelprose获取。
引用
@article{arxiv.2406.10328,
title = {From Pixels to Prose: A Large Dataset of Dense Image Captions},
author = {Vasu Singla and Kaiyu Yue and Sukriti Paul and Reza Shirkavand and Mayuka Jayawardhana and Alireza Ganjdanesh and Heng Huang and Abhinav Bhatele and Gowthami Somepalli and Tom Goldstein},
journal= {arXiv preprint arXiv:2406.10328},
year = {2024}
}
备注
pixelprose 16M dataset