视频重定位
计算机视觉与模式识别
2018-08-07 v1
摘要
已开发许多方法以帮助人们高效找到所需视频内容。然而该领域仍存在一些未解决问题。例如,给定查询视频与参考视频,如何精确地在参考视频中定位一个片段,使其语义对应于查询视频?我们定义了一项全新任务,即 \textbf{视频重定位},以应对此场景。视频重定位是一项重要的新兴技术,涉及诸多应用,如视频快速检索、视频拷贝检测、视频监控等。同时它也是一项具有挑战性的研究任务,因为视频中语义概念的视觉外观可能有很大差异。视频重定位任务的首要障碍是缺乏现有数据集。收集具有语义连贯性或对应关系的视频对并标注相应片段成本高昂。我们首先利用并重组 ActivityNet 中的视频,构建用于视频重定位研究的新型数据集,其包含约 10,000 个具有不同视觉外观且带有定位边界信息的视频。随后,我们提出一种创新的跨门控双线性匹配模型,使参考视频中的每个时间步都与经注意力加权的查询视频进行匹配。进而,起止时间的预测被表述为基于匹配结果的分类问题。大量实验结果表明所提方法优于对比方法。我们的代码见:https://github.com/fengyang0317/video_reloc。
引用
@article{arxiv.1808.01575,
title = {Video Re-localization},
author = {Yang Feng and Lin Ma and Wei Liu and Tong Zhang and Jiebo Luo},
journal= {arXiv preprint arXiv:1808.01575},
year = {2018}
}