编码未见内容:面向可扩展流中检索的预测式视频哈希
计算机视觉与模式识别
2020-10-05 v2
摘要
本文解决了计算机视觉中的一个新问题:流中视频到视频检索。该任务包含搜索数据库中与正在播放的视频(例如来自直播流)相似的内容,呈现出具有挑战性的特点。仅视频的开头部分可作为查询,且随着视频播放新帧不断加入。为在如此严苛的情况下执行检索,我们提出一种基于二进制编码器的方法,该编码器兼具预测性与增量性,以(1)考虑查询时缺失的视频内容,以及(2)应对整个流式过程中重复、持续演化的查询。特别地,我们提出了首个哈希框架,可推断当前播放视频的未见未来内容。在 FCVID 和 ActivityNet 上的实验证明了该任务的可行性。与文献中为该任务改编的基线相比,我们的方法也带来了显著的 mAP@20 性能提升,例如在 FCVID 上使用 192 位比特码时,在已播放时长 20%(50%)处分别提升 7.4%(2.6%)。
引用
@article{arxiv.2009.14661,
title = {Encode the Unseen: Predictive Video Hashing for Scalable Mid-Stream Retrieval},
author = {Tong Yu and Nicolas Padoy},
journal= {arXiv preprint arXiv:2009.14661},
year = {2020}
}
备注
Accepted at ACCV 2020