中文

面向大规模视觉语言模型预训练的低幻觉合成标题

计算机视觉与模式识别 2025-05-20 v2 人工智能

摘要

近年来,视觉语言模型预训练领域取得了快速进展,这主要归功于大语言模型文本能力的持续提升。然而,现有的多模态大语言模型训练范式严重依赖高质量的图像文本对。随着模型和数据规模的指数级增长,此类精心策划的数据变得日益稀缺和饱和,从而严重限制了该领域的进一步发展。本研究探索了面向视觉语言模型预训练的可扩展标题生成技术,证明大规模低幻觉合成标题可 serve 双重目的:1) 作为真实世界数据的可行替代方案用于预训练范式;2) 通过经验验证实现卓越的性能提升。本文作出以下关键贡献:1) 提出一种新型管道,用于生成高质量、低幻觉且富有知识性的合成标题。我们的连续DPO方法在减少幻觉方面取得了显著成果。具体而言,对于7B规模的模型,测试集上非幻觉标题比率从48.3%提升至77.9%。2) 综合实证验证表明,我们的合成标题为视觉语言模型提供了优于原生数据的预训练优势。在15个视觉语言任务中,使用我们数据训练的模型相较于相同图像的备选文本性能提升至少6.2%。在20个常见认知领域中,使用我们数据训练的模型在备选文本数据中获胜至少7.5%。同时,它在文本到图像领域也提供了可观支持。使用我们数据集,FID分数在真实世界验证基准上降低17.1,在MSCOCO验证基准上降低13.3。

关键词

引用

@article{arxiv.2504.13123,
  title  = {Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training},
  author = {Xinsong Zhang and Yarong Zeng and Xinting Huang and Hu Hu and Runquan Xie and Han Hu and Zhanhui Kang},
  journal= {arXiv preprint arXiv:2504.13123},
  year   = {2025}
}