用于自监督视频哈希的对比掩码自编码器
计算机视觉与模式识别
2022-11-24 v2 人工智能
信息检索
摘要
自监督视频哈希(SSVH)模型学习在无真实标签监督下为视频生成短二进制表示,提升了大规模视频检索效率并吸引了越来越多的研究关注。SSVH的成功在于对视频内容的理解以及捕捉无标签视频间语义关系的能力。通常,最先进的SSVH方法在两段式训练流程中考虑这两点:首先通过实例级掩码-预测任务训练辅助网络,然后训练哈希模型以保留从辅助网络迁移的伪邻域结构。这种连续训练策略既不灵活也不必要。本文提出一种简洁而有效的一段式SSVH方法ConMH,在单一阶段中融合视频语义信息与视频相似性关系理解。为捕捉视频语义信息以改进哈希学习,我们采用编码器-解码器结构从其时间掩码帧重建视频。特别地,我们发现更高的掩码比例有助于视频理解。此外,我们通过最大化同一视频两个增强视图间的一致性来充分利用视频间相似性关系,从而贡献于更具区分性与鲁棒性的哈希码。在三个大规模视频数据集(即FCVID、ActivityNet和YFCC)上的大量实验表明ConMH取得了最先进的结果。代码见https://github.com/huangmozhi9527/ConMH。
引用
@article{arxiv.2211.11210,
title = {Contrastive Masked Autoencoders for Self-Supervised Video Hashing},
author = {Yuting Wang and Jinpeng Wang and Bin Chen and Ziyun Zeng and Shutao Xia},
journal= {arXiv preprint arXiv:2211.11210},
year = {2022}
}
备注
This work is accepted by the AAAI 2023. 9 pages, 6 figures, 6 tables