R1-SyntheticVL:基于生成模型的多模态大语言模型合成数据就绪性研究
机器学习
2026-02-04 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
本文旨在开发有效的数据合成技术,自动为增强多模态大语言模型(MLLMs)解决复杂现实任务而生成多模态训练数据。为此,我们提出了集合对抗数据合成(CADS)方法,这是一种新颖且通用的合成高质量、多样且具挑战性多模态数据用于MLLMs的方法。CADS的核心思想是利用集合智慧确保高质量和多样性生成,同时通过对抗学习合成具有挑战性的样本以有效推动模型改进。具体而言,CADS包含两个循环阶段,即集合对抗数据生成(CAD-Generate)和集合对抗数据判断(CAD-Judge)。CAD-Generate利用集合知识联合生成新的且多样的多模态数据,而CAD-Judge则协作评估合成数据的质量。此外,CADS引入了对抗语境优化机制,以优化生成语境,鼓励生成具有挑战性和高价值的数据。通过CADS,我们构建了MMSynthetic-20K数据集,并训练了我们的模型R1-SyntheticVL,该模型在各种基准测试中表现出优异性能。
引用
@article{arxiv.2602.03300,
title = {R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?},
author = {Jingyi Zhang and Tianyi Lin and Huanjin Yao and Xiang Lan and Shunyu Liu and Jiaxing Huang},
journal= {arXiv preprint arXiv:2602.03300},
year = {2026}
}