中文

SBAT:基于稀疏边界感知 Transformer 的视频描述生成

计算机视觉与模式识别 2020-07-24 v1 计算与语言 机器学习 多媒体

摘要

在本文中,我们关注将 transformer 结构有效应用于视频描述生成的问题。原始的 transformer 是为机器翻译等单模态语言生成任务提出的。然而,视频描述生成是一个多模态学习问题,且视频特征在不同时间步之间存在大量冗余。基于这些考量,我们提出了一种称为稀疏边界感知 transformer(SBAT)的新方法来减少视频表示中的冗余。SBAT 对来自多头注意力的分数采用边界感知池化操作,并从不同场景中选取多样化特征。此外,SBAT 包含一种局部关联方案,以补偿稀疏操作带来的局部信息损失。基于 SBAT,我们进一步提出了一种对齐的跨模态编码方案来增强多模态交互。在两个基准数据集上的实验结果表明,在大多数指标下 SBAT 优于最先进的方法。

关键词

引用

@article{arxiv.2007.11888,
  title  = {SBAT: Video Captioning with Sparse Boundary-Aware Transformer},
  author = {Tao Jin and Siyu Huang and Ming Chen and Yingming Li and Zhongfei Zhang},
  journal= {arXiv preprint arXiv:2007.11888},
  year   = {2020}
}

备注

Appearing at IJCAI 2020