中文

赋能词语:面向结构化短语和句子级时间定位的DualGround

计算机视觉与模式识别 2025-10-24 v1 机器学习

摘要

视频时间定位(VTG)旨在定位长且未修剪视频中与给定自然语言查询对齐的时间片段。该任务通常包含两个子任务:时刻检索(MR)和精彩片段检测(HD)。尽管最近的进展得益于强大的预训练视觉-语言模型(如CLIP和InternVideo2),但现有方法通常在跨模态注意力中统一处理所有文本标记,忽略了它们不同的语义角色。为了验证这种方法的局限性,我们进行了受控实验,证明VTG模型过度依赖[EOS]驱动的全局语义,而未能有效利用词级信号,这限制了它们实现细粒度时间对齐的能力。受此局限性的启发,我们提出了DualGround,一种双分支架构,通过将[EOS]标记路由到句子级路径并将词标记聚类成短语级单元以进行局部定位,从而显式分离全局和局部语义。我们的方法引入了(1) 标记角色感知的跨模态交互策略,以结构解耦的方式将视频特征与句子级和短语级语义对齐,以及(2) 一个联合建模框架,不仅改进了全局句子级对齐,还通过利用结构化的短语感知上下文增强了细粒度时间定位。这种设计使模型能够捕获粗粒度和局部语义,从而实现更具表达力和上下文感知的视频定位。DualGround在QVHighlights和Charades-STA基准上的时刻检索和精彩片段检测任务中均达到了最先进的性能,证明了在视频-语言对齐中解耦语义建模的有效性。

关键词

引用

@article{arxiv.2510.20244,
  title  = {Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding},
  author = {Minseok Kang and Minhyeok Lee and Minjung Kim and Donghyeong Kim and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2510.20244},
  year   = {2025}
}

备注

Comments: 28 pages, including appendix. 5 figures. Full version of the NeurIPS 2025 paper