中文

用于多样化视频字幕的变分堆叠局部注意力网络

计算机视觉与模式识别 2022-01-05 v1 计算与语言

摘要

在用自然语言描述时空事件时,视频字幕模型主要依赖编码器的潜在视觉表示。近期编码器-解码器模型的进展主要在解码器的线性交互中关注编码器特征。然而,视觉数据模型复杂度的增长促使需要更显式的特征交互以获取细粒度信息,而这目前在视频字幕领域尚属缺失。此外,特征聚合方法已被用于揭示更丰富的视觉表示,或通过拼接或使用线性层实现。尽管视频的特征集在语义上具有一定重叠,这些方法导致了目标不匹配与特征冗余。另外,字幕的多样性是从多个有意义视角表达同一事件的基本组成部分,目前在时序即视频字幕领域仍然缺失。为此,我们提出变分堆叠局部注意力网络(VSLAN),其利用低秩双线性池化进行自注意力特征交互,并以折扣方式堆叠多个视频特征流。每个特征栈学到的属性贡献于我们提出的多样性编码模块,随后经解码查询阶段,以端到端方式生成多样化且自然的字幕,而无需对属性进行任何显式监督。我们在 MSVD 与 MSR-VTT 数据集上从语法与多样性方面评估 VSLAN。VSLAN 的 CIDEr 分数在 MSVD 上超越当前即用方法 7.8%7.8\%,在 MSR-VTT 上超越 4.5%4.5\%。在同一数据集上,VSLAN 在字幕多样性指标上取得了具竞争力的结果。

关键词

引用

@article{arxiv.2201.00985,
  title  = {Variational Stacked Local Attention Networks for Diverse Video Captioning},
  author = {Tonmoay Deb and Akib Sadmanee and Kishor Kumar Bhaumik and Amin Ahsan Ali and M Ashraful Amin and A K M Mahbubur Rahman},
  journal= {arXiv preprint arXiv:2201.00985},
  year   = {2022}
}

备注

To be published in Winter Conference on Applications of Computer Vision 2022