Oasis:仅需一张图像即可生成多模态指令数据
计算机视觉与模式识别
2025-03-27 v3 人工智能
摘要
多模态大语言模型(MLLM)的成功很大程度上归功于大规模训练数据。然而,许多 MLLM 的训练数据因隐私原因而无法获取。收集多模态数据的昂贵且耗时的过程进一步加剧了这一问题。有没有可能在不牺牲多样性和质量的前提下,自动合成多模态训练数据?本文提出了一种新方法,称为 Oasis,通过仅使用图像即可合成高质量的多模态数据。Oasis 突破了传统方法,仅向 MLLM 提供图像,从而大幅扩展了数据多样性。我们的方法具备精细的质量控制机制,以确保数据质量。我们收集了超过 50 万条数据,并在 LLaVA-NeXT 上进行了增量实验。广泛的实验结果表明,我们的方法能够显著提高 MLLM 的性能。图像基合成方法还使我们能够专注于 MLLM 的特定领域能力。代码和数据集已公开于 https://github.com/Letian2003/MM_INF。
关键词
引用
@article{arxiv.2503.08741,
title = {Oasis: One Image is All You Need for Multimodal Instruction Data Synthesis},
author = {Letian Zhang and Quan Cui and Bingchen Zhao and Cheng Yang},
journal= {arXiv preprint arXiv:2503.08741},
year = {2025}
}