基于图的时间聚合用于视频检索
计算机视觉与模式识别
2020-11-05 v1 信息检索
机器学习
摘要
大规模视频检索是一个有大量持续研究的领域。该领域多数工作是通过文本查询进行视频检索,使用如 VSE++ 等技术。然而,通过图像查询进行视频检索的研究很少,且已有工作要么使用来自视频数据集内部的图像查询,要么逐帧遍历视频。这些方法未针对数据集外部查询做泛化,且对大型视频数据集扩展性不佳。为克服这些问题,我们提出一种通过图像查询进行视频检索的新方法,其中从所有待搜索视频的帧的并集构建无向图。该图的节点特征用于视频检索任务。实验在 MSR-VTT 数据集上使用数据集外部的查询图像进行。为评估这一新方法,计算了 P@5、P@10 和 P@20 指标。本研究使用了两种不同的 ResNet 模型,即 ResNet-152 和 ResNet-50。
引用
@article{arxiv.2011.02426,
title = {Graph Based Temporal Aggregation for Video Retrieval},
author = {Arvind Srinivasan and Aprameya Bharadwaj and Aveek Saha and Subramanyam Natarajan},
journal= {arXiv preprint arXiv:2011.02426},
year = {2020}
}
备注
6 pages, 6 figures, 7 tables