中文

EVIDENT:通过实体锚定视觉证据进行跨域视频时间定位的 MLLM 适应

计算机视觉与模式识别 2026-05-26 v1

摘要

为视频时间定位微调 MLLM 时,往往能提升准域内表现,但在域移情境下性能会急剧下降。本文发现,这一失败主要不仅源于不可见查询概念,更源于视觉域移,这导致模型无法将已学习的时间局部化知识与其内在的实体注意力能力有效耦合。为此,我们提出 EVIDENT,一个通过在预训练 MLLM 中内在的实体注意力中锚定时间定位,引导 MLLM 通过显式视觉实体证据进行 VTG 适应的参数高效框架。EVIDENT 包含三个组件:(i) 实体瓶颈适配器,将稠密视觉 token 转换为紧凑的实体级槽位;(ii) 实体绑定蒸馏损失,为语义无结构的 MLLM 视觉空间注入对象性先验,引导每个槽位绑定到一个连贯的实体;(iii) 实体到 eVidence 的门控机制,利用捕获的实体作为证据,引导模型局部化包含查询相关实体的时刻。总体而言,这些组件使 VTG 微调依赖于实体锚定证据,而非脆弱的数据集捷径。实验表明,在跨域 VTG 基准测试上,EVIDENT 能持续提升外域鲁棒性,同时以适度的参数开销保持竞争的准域表现。这些结果表明,实体级锚定是通用时序局部化的有效归纳偏置。

关键词

引用

@article{arxiv.2605.26104,
  title  = {EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding},
  author = {Geo Ahn and Jiwook Han and Youngrae Kim and Joonseok Lee and Jinwoo Choi},
  journal= {arXiv preprint arXiv:2605.26104},
  year   = {2026}
}