ViSiL:细粒度时空视频相似度学习
计算机视觉与模式识别
2019-08-21 v1 信息检索
摘要
本文提出 ViSiL,一种考虑视频对之间细粒度时空关系的视频相似度学习(Video Similarity Learning)架构——此类关系在以往的视频检索方法中通常会丢失,因为它们在相似度估计之前将整帧甚至整个视频嵌入为向量描述符。相比之下,我们基于卷积神经网络(CNN)的方法被训练为从精细的帧到帧相似度矩阵计算视频到视频的相似度,从而同时考虑帧内与帧间关系。在所提方法中,通过对区域 CNN 帧特征应用张量点积(Tensor Dot, TD)继而采用倒角相似度(Chamfer Similarity, CS)来估计成对帧相似度——这避免了在帧间相似度计算之前进行特征聚合。随后,所有视频帧之间的相似度矩阵被输入一个四层 CNN,并使用倒角相似度(CS)汇总为视频到视频的相似度分数——这避免了在视频间相似度计算之前进行特征聚合,并捕获了匹配帧序列间的时间相似度模式。我们使用三元组损失(triplet loss)方案训练所提网络,并在四个不同视频检索问题上的五个公共基准数据集上对其进行评估,结果表明与当前最优(state of the art)方法相比有大幅提升。ViSiL 的实现已公开可用。
引用
@article{arxiv.1908.07410,
title = {ViSiL: Fine-grained Spatio-Temporal Video Similarity Learning},
author = {Giorgos Kordopatis-Zilos and Symeon Papadopoulos and Ioannis Patras and Ioannis Kompatsiaris},
journal= {arXiv preprint arXiv:1908.07410},
year = {2019}
}