中文

CHAIN:探索全局-局部时空信息以改进自监督视频哈希

计算机视觉与模式识别 2023-11-06 v1 人工智能

摘要

将视频压缩为二进制码可提升检索速度并降低存储开销。然而,由于视频帧间存在高局部冗余和复杂全局依赖,尤其在无标签情况下,学习准确的哈希码用于视频检索颇具挑战。现有自监督视频哈希方法在设计富有表现力的时序编码器方面有效,但因学习任务挑战性不足且不可靠,未能充分利用视频的时序动态与空间外观。为应对这些挑战,我们首先利用对比学习任务捕捉视频的全局时空信息以用于哈希。借助我们所设计的聚焦于空间与时间变化以构造正样本的增强策略,该学习框架可生成对运动、尺度和视角不变的哈希码。此外,我们引入两个协作学习任务,即帧顺序验证与场景变化正则化,以捕捉视频帧内的局部时空细节,从而增强对时间结构的感知与时空关系建模。我们提出的基于全局-局部时空信息的对比哈希(CHAIN)在四个视频基准数据集上优于最先进的自监督视频哈希方法。我们的代码将公开。

关键词

引用

@article{arxiv.2310.18926,
  title  = {CHAIN: Exploring Global-Local Spatio-Temporal Information for Improved Self-Supervised Video Hashing},
  author = {Rukai Wei and Yu Liu and Jingkuan Song and Heng Cui and Yanzhao Xie and Ke Zhou},
  journal= {arXiv preprint arXiv:2310.18926},
  year   = {2023}
}

备注

12 pages, 8 figures, accepted by ACM MM 2023