重访多模态基础模型预训练中的大规模图像-文本数据
计算机视觉与模式识别
2024-10-04 v1 人工智能
机器学习
摘要
近期多模态模型的进展凸显了重写标题对性能提升的价值,但仍存在关键挑战。例如,虽然合成标题常提供更高的质量和图像-文本对齐度,但是否可以完全取代 AltTexts 尚不明确:合成标题与原始网页爬取 AltTexts 的作用及其相互作用在预训练中仍未充分理解。此外,不同的多模态基础模型可能对特定标题格式有独特偏好,但识别为每个模型寻找最佳标题的努力仍有限。本文提出了一种新颖的、可控的、可扩展的标题生成管道,旨在为各种多模态模型生成多样化的标题格式。通过将短合成标题 (SSC) 作为稠密合成标题 (DSC+) 的案例研究,我们系统性地探讨了它们与 AltTexts 之间的作用及其在 CLIP、多模态 LLM 和扩散模型等模型中的效果。我们的发现表明,保持合成标题和 AltTexts 的混合方法可优于仅使用合成标题,两者结合不仅提升了对齐度,还提升了性能,每种模型均显示出对特定标题格式的偏好。这一全面分析提供了有价值的见解,以优化标题策略,从而推动多模态基础模型的预训练。
引用
@article{arxiv.2410.02740,
title = {Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models},
author = {Zhengfeng Lai and Vasileios Saveris and Chen Chen and Hong-You Chen and Haotian Zhang and Bowen Zhang and Juan Lao Tebar and Wenze Hu and Zhe Gan and Peter Grasch and Meng Cao and Yinfei Yang},
journal= {arXiv preprint arXiv:2410.02740},
year = {2024}
}
备注
CV/ML