中文

通过高质量数据策展实现可扩展的视觉语言模型训练

计算机视觉与模式识别 2025-06-10 v3 计算与语言

摘要

在本文中,我们介绍了SAIL-VL(通过高质量数据策展实现可扩展的视觉语言模型训练),这是一个开源视觉语言模型(VLM)系列,在2B和8B参数规模上达到了最先进的性能。以下三个关键改进促成了SAIL-VL的领先性能:(1)可扩展的高质量视觉理解数据构建:我们实现了一个数据构建流程,以实现亿级规模的高质量重标注数据标注。由此产生的数据集SAIL-Caption被验证为与开源数据集相比具有最高的数据质量。(2)使用高质量视觉理解数据的可扩展预训练:我们将SAIL-VL的预训练预算扩展到655B token,并表明即使是2B的VLM也能从扩大的训练数据规模中受益,在基准性能上表现出对数数据规模缩放定律。(3)通过数据量和复杂度缩放实现可扩展的SFT:我们策划了一个高质量SFT数据集集合,具有领先的数据量缩放有效性,并证明使用逐步更高复杂度的数据进行训练比基线的一阶段训练有大幅提升。SAIL-VL系列模型在我们评估的18个广泛使用的VLM基准中取得了最高平均分,其中2B模型在OpenCompass 2024(https://rank.opencompass.org.cn/leaderboard-multimodal)上占据了同等规模VLM的榜首位置,展示了强大的视觉理解能力。SAIL-VL系列模型已在HuggingFace(https://huggingface.co/BytedanceDouyinContent)上发布。

关键词

引用

@article{arxiv.2501.05952,
  title  = {Scalable Vision Language Model Training via High Quality Data Curation},
  author = {Hongyuan Dong and Zijian Kang and Weijie Yin and Xiao Liang and Chao Feng and Jiao Ran},
  journal= {arXiv preprint arXiv:2501.05952},
  year   = {2025}
}

备注

ACL 2025 Main Conference