Sparrow:一种基于文本到图像增强的数据高效视频-大语言模型
计算机视觉与模式识别
2025-07-23 v5 计算与语言
机器学习
摘要
近年来,多模态大语言模型(MLLM)在视觉理解领域取得了成功。这类模型的成功很大程度上归功于主导的尺度定律,即参数规模和数据量的增加有助于提升性能。值得注意的是,数据规模主要由自动数据管道驱动,这些管道专注于 LLM 的自指令化。尽管如此,这种数据增强范式长期以来被视为理所当然,而对规模化效果的研究则被忽视了很久。在此背景下,本工作重拾合成数据的规模化研究,聚焦于数据中心视角下开发视频-大语言模型。我们的主要研究方法是对预训练的图像-大语言模型使用视频数据进行微调,并通过数据规模检验学习效率。来自我们初步实验的结果表明,当仅简单地增加视频数据样本时会出现学习效率较低的现象,这可以通过我们的探测发现,归因于指令多样性不足。为此,我们提出一种称为 Sparrow 的数据增强方法,通过从纯文本指令数据合成类似视频的样本。将这些合成样本与视频数据混合使用可实现更高效的训练方案。通过全面实验,我们展示我们的方法在性能上可与或超过使用大量样本训练的基线模型相当。同时,我们发现纳入这些合成样本可提升长视频理解性能,无需在长视频数据上进行训练。代码和数据示例可访问 https://github.com/VITA-MLLM/Sparrow
引用
@article{arxiv.2411.19951,
title = {Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation},
author = {Shukang Yin and Chaoyou Fu and Sirui Zhao and Chunjiang Ge and Yan Yang and Yuhan Dai and Yongdong Luo and Tong Xu and Caifeng Shan and Enhong Chen},
journal= {arXiv preprint arXiv:2411.19951},
year = {2025}
}
备注
Project page: https://github.com/VITA-MLLM/Sparrow