中文

用于视频摘要的分层多模态Transformer

计算机视觉与模式识别 2021-09-23 v1 人工智能

摘要

尽管视频摘要已借助循环神经网络(RNN)取得了巨大成功,但基于RNN的方法忽略了视频帧之间的全局依赖和多跳关系,这限制了其性能。Transformer是处理该问题的有效模型,并在机器翻译、视频字幕生成等多个序列建模任务中超越了基于RNN的方法。受Transformer的巨大成功以及视频的自然结构(帧-镜头-视频)的启发,本文提出了一种用于视频摘要的分层Transformer,它能够捕捉帧与镜头之间的依赖关系,并利用镜头构成的场景信息来摘要视频。此外,我们认为音频与视觉信息对于视频摘要任务都至关重要。为了整合这两类信息,它们以双流方案进行编码,并基于分层Transformer开发了多模态融合机制。本文将所提方法记为分层多模态Transformer(HMT)。实际上,大量实验表明HMT超越了大多数传统的、基于RNN的以及基于注意力的视频摘要方法。

关键词

引用

@article{arxiv.2109.10559,
  title  = {Hierarchical Multimodal Transformer to Summarize Videos},
  author = {Bin Zhao and Maoguo Gong and Xuelong Li},
  journal= {arXiv preprint arXiv:2109.10559},
  year   = {2021}
}