中文

SwinBERT:用于视频字幕生成的具有稀疏注意力的端到端 Transformer 模型

计算机视觉与模式识别 2022-06-22 v4

摘要

视频字幕生成的典型方法要求字幕生成模型从离线提取的稠密视频特征中学习。这些特征提取器通常在固定帧率采样的视频帧上运行,且常在图像/视频理解任务上训练,未针对视频字幕数据进行调整。本工作中,我们提出 SwinBERT,一种基于 Transformer 的端到端视频字幕模型,它直接将视频帧图像块作为输入,并输出自然语言描述。我们的方法不借助多个 2D/3D 特征提取器,而是采用视频 Transformer 来编码时空表示,该表示可适应可变长度的视频输入,而无需针对不同帧率进行专门设计。基于此模型架构,我们表明视频字幕生成可显著受益于更稠密采样的视频帧,这与先前在视频与语言理解任务(如视频问答)中稀疏采样视频帧取得成功的情况相反。此外,为避免连续视频帧中固有的冗余,我们提出自适应地学习稀疏注意力掩码,并通过更好的长程视频序列建模将其优化以改进任务特定性能。通过在 5 个视频字幕数据集上的大量实验,我们表明 SwinBERT 相较先前方法实现了全面的性能提升,且常大幅领先。所学得的稀疏注意力掩码进一步将性能推至新的 SOTA,并且可在不同视频长度与不同数据集间迁移。代码见 https://github.com/microsoft/SwinBERT

关键词

引用

@article{arxiv.2111.13196,
  title  = {SwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning},
  author = {Kevin Lin and Linjie Li and Chung-Ching Lin and Faisal Ahmed and Zhe Gan and Zicheng Liu and Yumao Lu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2111.13196},
  year   = {2022}
}

备注

CVPR 2022