中文

基于分层二值自编码器的自监督视频哈希

计算机视觉与模式识别 2018-05-09 v1

摘要

现有的视频哈希函数建立在三个孤立的阶段之上:帧池化、松弛学习和二值化,未能在联合二值优化模型中充分探索视频帧的时间顺序,导致严重的信息损失。本文提出一种新颖的无监督视频哈希框架,称为自监督视频哈希(SSVH),能够以端到端的哈希学习方式捕捉视频的时间特性。我们具体解决两个核心问题:1)如何设计编码器-解码器架构以生成视频的二值码;2)如何使二值码具备准确的视频检索能力。我们设计了一种分层二值自编码器,以多粒度建模视频中的时间依赖关系,并以比堆叠架构更少的计算量将视频嵌入二值码中。随后,我们促使二值码同时重建视频的视觉内容与邻域结构。在两个真实世界数据集(FCVID 和 YFCC)上的实验表明,我们的 SSVH 方法能够显著优于最先进的方法,并在无监督视频检索任务上取得当前最佳性能。

关键词

引用

@article{arxiv.1802.02305,
  title  = {Self-Supervised Video Hashing with Hierarchical Binary Auto-encoder},
  author = {Jingkuan Song and Hanwang Zhang and Xiangpeng Li and Lianli Gao and Meng Wang and Richang Hong},
  journal= {arXiv preprint arXiv:1802.02305},
  year   = {2018}
}