SBAT:基于稀疏边界感知 Transformer 的视频描述生成
计算机视觉与模式识别
2020-07-24 v1 计算与语言
机器学习
多媒体
摘要
在本文中,我们关注将 transformer 结构有效应用于视频描述生成的问题。原始的 transformer 是为机器翻译等单模态语言生成任务提出的。然而,视频描述生成是一个多模态学习问题,且视频特征在不同时间步之间存在大量冗余。基于这些考量,我们提出了一种称为稀疏边界感知 transformer(SBAT)的新方法来减少视频表示中的冗余。SBAT 对来自多头注意力的分数采用边界感知池化操作,并从不同场景中选取多样化特征。此外,SBAT 包含一种局部关联方案,以补偿稀疏操作带来的局部信息损失。基于 SBAT,我们进一步提出了一种对齐的跨模态编码方案来增强多模态交互。在两个基准数据集上的实验结果表明,在大多数指标下 SBAT 优于最先进的方法。
引用
@article{arxiv.2007.11888,
title = {SBAT: Video Captioning with Sparse Boundary-Aware Transformer},
author = {Tao Jin and Siyu Huang and Ming Chen and Yingming Li and Zhongfei Zhang},
journal= {arXiv preprint arXiv:2007.11888},
year = {2020}
}
备注
Appearing at IJCAI 2020