中文

SnapCap:高效快照压缩视频描述

计算机视觉与模式识别 2024-01-11 v1

摘要

视频描述(VC)是一项具有挑战性的多模态任务,因为它需要通过理解各种复杂视频来用语言描述场景。对于机器而言,传统VC遵循“成像-压缩-解码-然后描述”的流程,其中压缩对于存储和传输至关重要。然而,在这样的流程中,一些潜在的缺陷不可避免,即信息冗余导致效率低下,以及描述采样过程中的信息丢失。为解决这些问题,本文提出了一种新颖的VC流程,直接从压缩测量值生成描述,该测量值可由快照压缩感知相机捕获,我们将模型命名为SnapCap。具体而言,得益于信号模拟,我们能够为模型获取丰富的测量值-视频-标注数据对。此外,为了更好地从压缩测量值中提取与语言相关的视觉表示,我们提出通过预训练的CLIP模型(具有丰富的语言-视觉关联)从视频中蒸馏知识,以指导SnapCap的学习。为证明SnapCap的有效性,我们在两个广泛使用的VC数据集上进行了实验。定性和定量结果均验证了我们的流程相较于传统VC流程的优越性。特别是,与“先重建后描述”的方法相比,我们的SnapCap运行速度至少快3倍,并能获得更好的描述结果。

关键词

引用

@article{arxiv.2401.04903,
  title  = {SnapCap: Efficient Snapshot Compressive Video Captioning},
  author = {Jianqiao Sun and Yudi Su and Hao Zhang and Ziheng Cheng and Zequn Zeng and Zhengjue Wang and Bo Chen and Xin Yuan},
  journal= {arXiv preprint arXiv:2401.04903},
  year   = {2024}
}

备注

Preprint; Under Review