中文

观看视频,捕捉关键词:用于时刻检索和精彩片段检测的上下文感知关键词注意力

计算机视觉与模式识别 2025-01-07 v1 人工智能

摘要

视频时刻检索和精彩片段检测的目标是基于给定的文本查询识别特定片段和精彩片段。随着视频内容的快速增长以及这些任务之间的重叠,最近的工作同时处理了这两个问题。然而,它们仍然难以完全捕捉整体视频上下文,从而难以确定哪些词最相关。在本文中,我们提出了一种新颖的视频上下文感知关键词注意力模块,通过捕捉整个视频上下文中的关键词变化来克服这一限制。为此,我们引入了一个视频上下文聚类模块,提供整体视频上下文的简洁表示,从而增强对关键词动态的理解。此外,我们提出了一个关键词权重检测模块,采用关键词感知对比学习,融入关键词信息以增强视觉和文本特征之间的细粒度对齐。在QVHighlights、TVSum和Charades-STA基准上的大量实验表明,与现有方法相比,我们提出的方法在时刻检索和精彩片段检测任务中显著提高了性能。我们的代码可在https://github.com/VisualAIKHU/Keyword-DETR获取。

关键词

引用

@article{arxiv.2501.02504,
  title  = {Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection},
  author = {Sung Jin Um and Dongjin Kim and Sangmin Lee and Jung Uk Kim},
  journal= {arXiv preprint arXiv:2501.02504},
  year   = {2025}
}

备注

Accepted at AAAI 2025