基于选择性时序空间的高效自监督视频哈希
计算机视觉与模式识别
2024-12-20 v1 信息检索
多媒体
摘要
自监督视频哈希(SSVH)是视频索引和检索中的一个实用任务。虽然Transformer在SSVH中占据主导地位,凭借出色的时序建模能力,但常常存在计算和内存效率不足的问题。借鉴Mamba——一种先进的时序空间模型的思想,我们探索其在SSVH中的潜力,以实现效果和效率之间的更好平衡。我们引入S5VH,一种基于Mamba的视频哈希模型,具有改进的自监督学习范例。具体而言,我们为编码器和解码器设计双向Mamba层,凭借数据依赖的选择性扫描机制具有线性复杂度,能够高效捕获时序关系。在我们的学习策略中,我们将特征空间中的全局语义转化为语义一致且具辨识力的哈希中心,随后采用中心对齐损失作为全局学习信号。我们的自局部-全局(SLG)范例显著提高了学习效率,导致更快的收敛。广泛的实验表明,S5VH在状态-of-the-art方法方面取得显著改进,表现出卓越的可迁移性和推理效率的可扩展优势。代码可在https://github.com/gimpong/AAAI25-S5VH获取。
引用
@article{arxiv.2412.14518,
title = {Efficient Self-Supervised Video Hashing with Selective State Spaces},
author = {Jinpeng Wang and Niu Lian and Jun Li and Yuting Wang and Yan Feng and Bin Chen and Yongbing Zhang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2412.14518},
year = {2024}
}
备注
Accepted by AAAI'25. 9 pages, 5 figures, 2 tables