中文

VVS:基于无关帧抑制的视频到视频检索

计算机视觉与模式识别 2023-12-20 v2

摘要

在基于内容的视频检索(CBVR)中,面对大规模集合,效率与精度同等重要;因此,若干基于视频级特征的研究已积极开展。然而,由于将冗长且未剪辑的视频嵌入单一特征的极大困难,相较于基于帧级特征的研究,这些研究在准确检索上尚显不足。本文中,我们表明对无关帧的适当抑制可为当前视频级方法的障碍提供启示。此外,我们提出视频到视频抑制网络(VVS)作为解决方案。VVS 是一个端到端框架,由用于识别待移除帧的简易干扰项消除阶段,以及用于确定剩余帧抑制程度的抑制权重生成阶段组成。该结构旨在有效描述含有变化内容与无意义信息的未剪辑视频。其有效性通过大量实验得到证明,并且我们表明我们的方法不仅在视频级方法中达到 SOTA,而且尽管具备接近帧级方法的检索能力,仍具有快速推理时间。代码见 https://github.com/sejong-rcv/VVS

关键词

引用

@article{arxiv.2303.08906,
  title  = {VVS: Video-to-Video Retrieval with Irrelevant Frame Suppression},
  author = {Won Jo and Geuntaek Lim and Gwangjin Lee and Hyunwoo Kim and Byungsoo Ko and Yukyung Choi},
  journal= {arXiv preprint arXiv:2303.08906},
  year   = {2023}
}

备注

AAAI-24