中文

CVA:面向视频时间定位的上下文感知视频文本对齐

机器学习 2026-03-27 v1 人工智能 计算机视觉与模式识别

摘要

我们提出 Context-aware Video-text Alignment(CVA),一个新型框架,用于解决视频时间定位中的重要挑战:实现对不相关背景上下文仍保持鲁健的时序感知视频文本对齐。我们的框架由三个关键组件构成。首先,我们提出 Query-aware Context Diversification(QCD),一种新的数据增强策略,确保仅混合语义无关的内容。它构建一个基于视频文本相似性的替换片段池,以模拟多样化的上下文,同时防止 query-agnostic 混合导致的“假负例”。其次,我们引入 Context-invariant Boundary Discrimination(CBD)损失,一种对比损失,用于在挑战性时序边界处强化语义一致性,使其表示对上下文迁移和 hard 负例更具鲁健性。再者,我们引入 Context-enhanced Transformer Encoder(CTE),一种分层架构,将窗口自注意力和双向交叉注意力与可学习查询结合,以捕获多尺度时序上下文。通过这些数据导向和架构性增强的协同作用,CVA 在主要视频时间定位基准(包括 QVHighlights 和 Charades-STA)上实现了最先进的性能。值得注意的是,我们的方法在 Recall@1(R1)得分上比最先进的方法提高了约 5 分,凸显了其在缓解假负例方面的有效性。

关键词

引用

@article{arxiv.2603.24934,
  title  = {CVA: Context-aware Video-text Alignment for Video Temporal Grounding},
  author = {Sungho Moon and Seunghun Lee and Jiwan Seo and Sunghoon Im},
  journal= {arXiv preprint arXiv:2603.24934},
  year   = {2026}
}

备注

Accepted to CVPR 2026