中文

基于图的时间聚合用于视频检索

计算机视觉与模式识别 2020-11-05 v1 信息检索 机器学习

摘要

大规模视频检索是一个有大量持续研究的领域。该领域多数工作是通过文本查询进行视频检索,使用如 VSE++ 等技术。然而,通过图像查询进行视频检索的研究很少,且已有工作要么使用来自视频数据集内部的图像查询,要么逐帧遍历视频。这些方法未针对数据集外部查询做泛化,且对大型视频数据集扩展性不佳。为克服这些问题,我们提出一种通过图像查询进行视频检索的新方法,其中从所有待搜索视频的帧的并集构建无向图。该图的节点特征用于视频检索任务。实验在 MSR-VTT 数据集上使用数据集外部的查询图像进行。为评估这一新方法,计算了 P@5、P@10 和 P@20 指标。本研究使用了两种不同的 ResNet 模型,即 ResNet-152 和 ResNet-50。

关键词

引用

@article{arxiv.2011.02426,
  title  = {Graph Based Temporal Aggregation for Video Retrieval},
  author = {Arvind Srinivasan and Aprameya Bharadwaj and Aveek Saha and Subramanyam Natarajan},
  journal= {arXiv preprint arXiv:2011.02426},
  year   = {2020}
}

备注

6 pages, 6 figures, 7 tables