SynthVLM:面向视觉语言模型的高质量、高效图像-标题对合成
计算机视觉与模式识别
2025-08-12 v5 计算与语言
摘要
视觉语言模型(Vision-Language Models, VLMs)近期涌现,展现出卓越的视觉理解能力。然而,训练这些模型需要大规模数据集,这带来了效率、效果和网络数据质量方面的挑战。本文介绍了 SynthVLM,一种新的数据合成与筛选方法,用于生成图像-标题对。与传统的从图像生成标题的方法不同,SynthVLM 利用先进的扩散模型和高品质标题,从文本标题合成并筛选图像,从而生成精确对齐的图像-文本对。我们进一步推出了 SynthVLM-100K,一个包含 100K 对精选和合成图像-标题对的高质量数据集。在模型评估和人工评估中,SynthVLM-100K 均优于传统的真实世界数据集。利用该数据集,我们开发了新的多模态大语言模型(Multimodal Large Language Models, MLLMs)系列 SynthVLM-7B 和 SynthVLM-13B,它们在各种视觉问答(VQA)任务上取得了最先进的(state-of-the-art, SOTA)性能。值得注意的是,我们的模型仅使用 18% 的预训练数据,就在大多数指标上超越了 LLaVA。此外,SynthVLM-7B 和 SynthVLM-13B 在 MMLU 基准上取得了 SOTA 性能,表明高质量的 SynthVLM-100K 数据集保留了语言能力。
关键词
引用
@article{arxiv.2407.20756,
title = {SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models},
author = {Zheng Liu and Hao Liang and Bozhou Li and Wentao Xiong and Chong Chen and Conghui He and Wentao Zhang and Bin Cui},
journal= {arXiv preprint arXiv:2407.20756},
year = {2025}
}