面向视觉语言模型训练的文本-only 数据合成
人工智能
2026-05-28 v2 计算机视觉与模式识别
多媒体
摘要
视觉语言模型 (VLM) 的训练通常需要大规模高质量的图像-文本配对,但获取或合成此类数据成本较高。相比之下,文本数据充足且成本低,因而催生了这样的问题:是否可以仅从文本中合成高质量的多模态训练数据?为此,我们提出一种跨集成三阶段多模态数据合成框架,生成两个数据集:Unicorn-1.2M 和 Unicorn-471K-Instruction。在阶段 1:多样化标题数据合成中,我们通过扩展稀疏标题种子来构建 120 万条语义多样化的高质量标题。在阶段 2:指令调优数据生成中,我们进一步处理 47 万条标题,生成多轮指令调优任务以支持复杂推理。最后,在阶段 3:模态表示迁移中,这些文本标题的表示被转化为视觉表示,形成多样化的合成图像表示。该三阶段过程使我们能够在不依赖真实图像的情况下构建 Unicorn-1.2M 用于预训练和 Unicorn-471K-Instruction 用于指令调优。通过消除对真实图像的依赖且保持数据质量和多样性,我们的方法为 VLM 训练提供了一种高性价比且可扩展的解决方案。
引用
@article{arxiv.2503.22655,
title = {Text-Only Data Synthesis for Vision Language Model Training},
author = {Xiaomin Yu and Wenjie Zhang and Ziyue Qiao and Chengwei Qin and Hui Xiong},
journal= {arXiv preprint arXiv:2503.22655},
year = {2026}
}