中文

多模态 LLM 视频时间 grounding 丰富与检测

计算机视觉与模式识别 2025-10-21 v1 多媒体

摘要

我们提出了 ED-VTG 方法,用于细粒度视频时间 grounding,利用多模态大语言模型。我们的做法利用多模态 LLM 的能力,联合处理文本和视频,以有效地通过两个阶段对自然语言查询在视频中的局部化。与其直接进行 grounding,不如首先将语言查询转换为包含遗漏细节和线索的丰富句子,以辅助 grounding。在第二个阶段,这些丰富查询通过轻量级解码器进行 grounding,解码器专门用于在上下文化的丰富查询表示条件下预测准确的边界。为缓解噪声并减少幻觉影响,我们的模型使用多个实例学习目标进行训练,该目标动态选择每个训练样本的最佳查询版本。我们在各种基准测试的 temporal video grounding 和 paragraph grounding 设置下 demonstrate 了 state-of-the-art 结果。实验表明,我们的方法在各种基于 LLM 的 temporal grounding 方法中显著优于所有先前提出的方法,在 specialized models 中要么优于,要么与之相当,同时在 zero-shot 评估场景中保持明显优势。

关键词

引用

@article{arxiv.2510.17023,
  title  = {Enrich and Detect: Video Temporal Grounding with Multimodal LLMs},
  author = {Shraman Pramanick and Effrosyni Mavroudi and Yale Song and Rama Chellappa and Lorenzo Torresani and Triantafyllos Afouras},
  journal= {arXiv preprint arXiv:2510.17023},
  year   = {2025}
}

备注

ICCV 2025 (Highlights)