中文

DaMO:面向视频大语言模型时间推理的数据高效多模态编排器

计算机视觉与模式识别 2026-01-29 v4 人工智能 计算与语言

摘要

大语言模型(LLM)近期已扩展至视频领域,实现了复杂的视频-语言理解。然而,现有的视频大语言模型在细粒度时间推理方面存在局限性,限制了其将响应精确归因到特定视频时刻的能力,尤其是在监督受限的情况下。我们提出了 DaMO,一个专为精确时间推理和多模态理解设计的数据高效视频大语言模型。其核心所提出的 Temporal-aware Fuseformer 采用分层双流架构,逐步捕获各模态内的时间动态,并有效融合互补的视觉和音频信息。为进一步提升计算效率,DaMO 集成了全局残差以减少空间冗余,同时保留关键的语义细节。我们通过结构化的四阶段渐进训练范式训练 DaMO,逐步赋予模型多模态对齐、语义 grounding 和时间推理能力。本工作还贡献了多个从现有数据集增强而来的数据集,包含大语言模型生成的时间 grounding QA 对,以支持需要时间监督的任务。在时间定位和视频问答基准上的全面实验表明,DaMO 持续超越先前方法,尤其是在需要精确时间对齐和推理的任务中。我们的工作为数据高效的视频-语言建模建立了有前景的方向。

关键词

引用

@article{arxiv.2506.11558,
  title  = {DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs},
  author = {Bo-Cheng Chiu and Jen-Jee Chen and Yu-Chee Tseng and Feng-Chi Chen and An-Zi Yen},
  journal= {arXiv preprint arXiv:2506.11558},
  year   = {2026}
}