中文

基于自适应时空注意的多样化视频描述生成

计算机视觉与模式识别 2022-08-22 v1

摘要

为视频生成恰当的描述,推理需要识别相关概念,并关注它们之间的空间关系以及片段中的时间发展。我们的端到端编码器-解码器视频描述框架结合了两种基于 transformer 的架构:一种用于单一联合时空视频分析的适配 transformer,以及一种基于自注意力解码器用于高级文本生成。此外,我们引入了一种自适应帧选择方案,在训练两个 transformer 时减少所需输入帧数,同时保持相关内容。另外,我们通过聚合每个样本的所有真实描述来估计与视频描述相关的语义概念。我们的方法在 MSVD 以及大规模 MSR-VTT 和 VATEX 基准数据集上,考虑多个自然语言生成(NLG)指标,取得了最先进的结果。关于多样性分数的额外评估凸显了我们生成描述在结构上的表现力与多样性。

关键词

引用

@article{arxiv.2208.09266,
  title  = {Diverse Video Captioning by Adaptive Spatio-temporal Attention},
  author = {Zohreh Ghaderi and Leonard Salewski and Hendrik P. A. Lensch},
  journal= {arXiv preprint arXiv:2208.09266},
  year   = {2022}
}