中文

MLLMs 能在言前知晓:通过注意力线索揭示并恢复时序 grounding

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

视频时序 grounding (VTG) 是对无剪辑视频中被查询事件的起始和结束时间进行定位,是检验多模态大语言模型(MLLMs)是否不仅理解事件内容,还理解事件发生时间的关键性测试。尽管现代MLLMs能够流畅描述视频内容,但其时间戳预测仍不可靠,而现有补救方法要么需要对时序标注进行高成本的后训练,要么依赖粗糙的训练-free 启发式方法。在本工作中,我们探讨MLLMs的跨模态注意力,发现感知-生成之间存在间隙。我们的关键发现是,MLLMs在 prefill 阶段常常知道目标区间,但在生成最终答案时会丢失这一信号。在 prefill 阶段,一组稀疏注意力头(我们称为 \emph{Temporal Grounding Heads} (TG-Heads))将查询-视频注意力集中在真实区间上。而在自回归解码过程中,答案 token 会将注意力从该区间转向视觉显著但与查询无关的片段。此观察启发了一个基于 inference-time 的 read-then-regenerate 框架。我们首先将 TG-Head prefill 注意力转换为无偏帧级相关信号,并提取其高注意力区间所突出的区间。随后,我们限制仅使用该区间的视觉上下文重新调用 MLLM,通过视频裁剪或注意力掩码来抑制干扰因素。在无需参数更新和架构修改的情况下,我们的框架在三个 VTG 数据集上一致性地改善了 MiMo-VL-7B、Qwen3-VL-8B 和 TimeLens-8B,提升幅度最高可达 +3.5 mIoU。项目网站可在 https://ddz16.github.io/mllmsknowwhen.github.io/ 查找。

关键词

引用

@article{arxiv.2605.21954,
  title  = {MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues},
  author = {Dazhao Du and Liao Duan and Jian Liu and Tao Han and Yujia Zhang and Eric Liu and Xi Chen and Song Guo},
  journal= {arXiv preprint arXiv:2605.21954},
  year   = {2026}
}

备注

Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/