利用图像描述生成改进多模态数据集
机器学习
2023-10-27 v2 计算机视觉与模式识别
摘要
海量网络数据集在 CLIP 和 Flamingo 等大型视觉-语言模型的成功中起着关键作用。然而,原始网络数据含有噪声,且现有的降噪过滤方法常以数据多样性为代价。我们的工作聚焦于描述文本质量这一主要噪声来源,研究生成的描述如何提升具有乏味文本的网络抓取数据点的效用。通过探索原始与生成描述的混合策略,在 1.28 亿图像-文本对的候选池中,我们在 ImageNet 上比 DataComp 基准提出的最佳过滤方法高出 2%,在 38 项任务上平均高出 4%。我们的最佳方法在 Flickr 和 MS-COCO 检索上也好 2 倍。我们随后分析了是什么使合成描述成为有效的文本监督来源。在试验不同图像描述模型时,我们还表明模型在标准图像描述基准(如 NoCaps CIDEr)上的性能并不能可靠指示其生成描述对多模态训练的效用。最后,我们在 DataComp 大规模(12.8 亿图像-文本对)上使用生成描述的实验,揭示了合成文本的局限性,以及随着训练数据量增加的图片筛选的重要性。我们实验中使用的合成描述现已发布于 HuggingFace。
引用
@article{arxiv.2307.10350,
title = {Improving Multimodal Datasets with Image Captioning},
author = {Thao Nguyen and Samir Yitzhak Gadre and Gabriel Ilharco and Sewoong Oh and Ludwig Schmidt},
journal= {arXiv preprint arXiv:2307.10350},
year = {2023}
}
备注
Accepted at NeurIPS 2023 Datasets & Benchmarks