中文

准确且快速的压缩视频字幕生成

计算机视觉与模式识别 2024-01-04 v2 人工智能

摘要

现有的视频字幕方法通常需要先从解码后的视频中采样视频帧,再进行后续处理(例如特征提取和/或字幕模型学习)。在该流程中,人工帧采样可能忽略视频中的关键信息,从而降级性能。此外,采样帧中的冗余信息可能导致视频字幕推理效率低下。针对此,我们从压缩域的不同视角研究视频字幕,相较于现有流程带来多重优势:1)与解码视频中的原始图像相比,由I帧、运动矢量和残差组成的压缩视频具有高度可区分性,这使我们能够通过专门的模型设计利用整个视频进行学习,而无需人工采样;2)由于处理的信息更小且冗余更少,字幕模型在推理时更高效。我们提出了一种简单而有效的压缩域端到端Transformer用于视频字幕,能够从压缩视频中学习以生成字幕。我们表明,即使设计简单,我们的方法在不同基准上也能达到最先进性能,同时运行速度比现有方法快近2倍。代码见 https://github.com/acherstyx/CoCap。

关键词

引用

@article{arxiv.2309.12867,
  title  = {Accurate and Fast Compressed Video Captioning},
  author = {Yaojie Shen and Xin Gu and Kai Xu and Heng Fan and Longyin Wen and Libo Zhang},
  journal= {arXiv preprint arXiv:2309.12867},
  year   = {2024}
}

备注

ICCV 2023