自监督视频检索 Transformer 网络
计算机视觉与模式识别
2021-04-19 v1
摘要
基于内容的视频检索旨在从大型视频数据库中找到与给定查询视频相似甚至近似重复的视频。视频表示和相似度搜索算法对任何视频检索系统都至关重要。为获得有效视频表示,大多数视频检索系统需要大量人工标注数据用于训练,成本高且效率低。此外,大多数检索系统基于帧级特征进行视频相似度搜索,在存储和搜索上均开销昂贵。我们提出了一种新颖的视频检索系统,称为 SVRTN,有效解决了上述缺陷。它首先应用自监督训练从未标注数据中有效学习视频表示,以避免人工标注的高昂成本。然后,它利用 transformer 结构将帧级特征聚合为片段级,以减少存储空间和搜索复杂度。它可以从片段帧间的交互中学习互补和判别性信息,并获得帧排列与缺失不变能力以支持更灵活的检索方式。在两个具挑战性的视频检索数据集 FIVR-200K 和 SVD 上的综合实验验证了我们所提 SVRTN 方法的有效性,其在准确率和效率上均取得了最佳的视频检索性能。
引用
@article{arxiv.2104.07993,
title = {Self-supervised Video Retrieval Transformer Network},
author = {Xiangteng He and Yulin Pan and Mingqian Tang and Yiliang Lv},
journal= {arXiv preprint arXiv:2104.07993},
year = {2021}
}