中文

如何输出视频中的时间?高效时序 grounding 范式分析

计算机视觉与模式识别 2026-04-13 v1

摘要

尽管多模态大语言模型 (MLLMs) 在视频时序 grounding (VTG) 方面取得了进展,但现有方法往往将输出范式与不同的 backbone、数据集和训练协议耦合,这使得很难分离具体的输出设计影响。此外,随着 VTG 系统越来越多地被用于资源受限的边缘部署,需要系统性地调查输出范式与系统级效率之间的权衡。本文提出了一项受控实证研究,比较了三种主导的 VTG 输出范式:文本数字生成、时序标记生成和连续时序解码。我们在相同的紧凑型 VLMs (SmolVLM2、FastVLM 和 Molmo2) 上评估这些范式,使用一致的数据集和 LoRA 微调协议。在 Charades-STA、QVHighlights 和 YouCook2 上进行评估,衡量 localisation 准确性和系统效率,包括推理延迟、训练吞吐量和参数开销。我们的结果表明,输出范式的选择对 grounding 准确性和计算成本都有显著影响,独立于模型规模。具体而言,连续分布范式在 Pareto 前沿上始终实现最有利的效率-准确性权衡,能够以最小的延迟开销实现稳健的 localisation。这些发现为设计高效、面向部署的 VTG 系统提供了客观的实证指导。

关键词

引用

@article{arxiv.2604.08966,
  title  = {How Should Video LLMs Output Time? An Analysis of Efficient Temporal Grounding Paradigms},
  author = {Shengji Jin and Yuanhao Zou and Victor Zhu and Zhengping Ji and Chen Chen},
  journal= {arXiv preprint arXiv:2604.08966},
  year   = {2026}
}

备注

CVPR 2026 Workshop Paper