DOCCI:连通与对比图像描述
计算机视觉与模式识别
2024-05-01 v1 人工智能
计算与语言
机器学习
摘要
视觉语言数据集对文本到图像(T2I)和图像到文本(I2T)研究至关重要。然而,当前数据集缺乏细粒度描述,限制了模型学习更丰富的关联。为填补这一空白,我们介绍Descriptions of Connected and Contrasting Images (DOCCI),一个包含15k张图片的人工标注长描述数据集。这些图片由单一位研究者拍摄、精选并捐赠,旨在捕捉空间关系、计数、文本渲染、世界知识等关键挑战。我们指示人工标注者为每张图片创建全面描述;这些描述平均长度为136个单词,旨在清晰区分每个图片与其他相关或相似图片。每条描述都高度构成性,通常涵盖多个挑战。通过定性和定量分析,我们证明DOCCI是图像到文本生成的有效训练资源——在DOCCI上微调的PaLI 5B模型显示出与LLaVA-1.5 7B和InstructBLIP 7B等高性能大型模型相当或更好的结果。此外,我们表明DOCCI也是文本到图像生成的有用测试平台,凸显了当前文本到图像模型在捕捉长描述和细节方面的局限性。
引用
@article{arxiv.2404.19753,
title = {DOCCI: Descriptions of Connected and Contrasting Images},
author = {Yasumasa Onoe and Sunayana Rane and Zachary Berger and Yonatan Bitton and Jaemin Cho and Roopal Garg and Alexander Ku and Zarana Parekh and Jordi Pont-Tuset and Garrett Tanzer and Su Wang and Jason Baldridge},
journal= {arXiv preprint arXiv:2404.19753},
year = {2024}
}