CapsFusion:重新审视大规模图像-文本数据
计算机视觉与模式识别
2024-04-08 v3 人工智能
计算与语言
机器学习
摘要
大型多模态模型展现出以零样本方式执行多样化多模态任务的卓越通用能力。大规模基于网络的图像-文本对对这一成功起到了根本性作用,但存在过度噪声问题。近期研究使用由描述生成模型合成的替代性 caption,并取得了显著的基准性能。然而,我们的实验揭示了使用合成 caption 训练的模型中存在的显著可扩展性缺陷与世界知识丢失问题,这些问题被其初始基准成功所掩盖。经更仔细考察,我们将根本原因确定为现有合成 caption 中过于简化的语言结构和知识细节的缺乏。为提供更高质且更具可扩展性的多模态预训练数据,我们提出 CapsFusion,一个利用大型语言模型整合与精炼来自基于网络的图像-文本对和合成 caption 信息的先进框架。大量实验表明,CapsFusion caption 在模型性能(如 COCO 和 NoCaps 上 CIDEr 分数提升 18.8 和 18.3)、样本效率(比基线少需 11-16 倍计算量)、世界知识深度和可扩展性方面,相对现有 caption 展现出全方位优势。这些有效性、效率与可扩展性优势使 CapsFusion 成为未来 LMM 训练扩展的有前途候选。
引用
@article{arxiv.2310.20550,
title = {CapsFusion: Rethinking Image-Text Data at Scale},
author = {Qiying Yu and Quan Sun and Xiaosong Zhang and Yufeng Cui and Fan Zhang and Yue Cao and Xinlong Wang and Jingjing Liu},
journal= {arXiv preprint arXiv:2310.20550},
year = {2024}
}
备注
CVPR 2024. Code & Dataset: https://github.com/baaivision/CapsFusion