中文

全能一体:用于多模态视频理解的统一合成数据管道

计算机视觉与模式识别 2026-04-15 v1 机器学习

摘要

训练用于视频理解的多模态大语言模型(MLLM)需要大规模标注数据,涵盖对象计数、问答和分割等多样化任务。然而,实施中收集和标注多模态视频数据成本高昂、缓慢,且在多样性和覆盖范围上受限。为此,我们提出一种统一的合成数据生成管道,能够自动生产无限多模态视频数据,具备丰富且多样化的监督。我们的框架支持单一管道内的多种任务格式,实现跨任务的可扩展且一致的数据创建。为进一步提升推理能力,我们引入基于 VQA 的微调策略,训练模型对视觉内容进行结构化问题回答,而非仅依赖标题或简单指令。这一表述鼓励更深入的视觉对齐和推理。我们在三个具有挑战性的任务上进行评估:视频对象计数、基于视频的视觉问答和视频对象分割。实验结果表明,主要基于合成数据训练的模型在实际数据集上具备良好的泛化能力,常常优于传统训练的方法。我们的发现凸显了统一合成数据管道作为大规模实用标注的可行替代方案的潜力,用于多模态视频理解。

关键词

引用

@article{arxiv.2604.12335,
  title  = {All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding},
  author = {Tanzila Rahman and Renjie Liao and Leonid Sigal},
  journal= {arXiv preprint arXiv:2604.12335},
  year   = {2026}
}

备注

8 Pages, 4 Tables, 4 Figures