中文

面向时刻检索与高亮检测的查询依赖视频表示

计算机视觉与模式识别 2023-03-27 v1 人工智能

摘要

近来,随着视频理解需求急剧增长,视频时刻检索与高亮检测(MR/HD)备受关注。MR/HD的关键目标是定位时刻并估计片段级与给定文本查询的相符程度,即显著性分数。尽管近期基于transformer的模型带来了一些进展,我们发现这些方法并未充分利用给定查询的信息。例如,在预测时刻及其显著性时,文本查询与视频内容之间的相关性有时被忽视。为解决此问题,我们引入查询依赖DETR(QD-DETR),一种为MR/HD定制的检测transformer。由于我们观察到给定查询在transformer架构中作用不显著,我们的编码模块以交叉注意力层起始,将文本查询的上下文显式注入视频表示。接着,为增强模型利用查询信息的能力,我们操纵视频-查询对以产生不相关对。此类负(不相关)视频-查询对被训练以产生低显著性分数,进而促使模型估计查询-视频对间的精确相符度。最后,我们提出一种输入自适应显著性预测器,为给定视频-查询对自适应定义显著性分数准则。我们广泛的研究验证了构建查询依赖表示对MR/HD的重要性。具体而言,QD-DETR在QVHighlights、TVSum和Charades-STA数据集上优于SOTA方法。代码见github.com/wjun0830/QD-DETR。

关键词

引用

@article{arxiv.2303.13874,
  title  = {Query-Dependent Video Representation for Moment Retrieval and Highlight Detection},
  author = {WonJun Moon and Sangeek Hyun and SangUk Park and Dongchan Park and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2303.13874},
  year   = {2023}
}

备注

Accepted to CVPR 2023. Code is available at https://github.com/wjun0830/QD-DETR