中文

SACT:用于视频描述中多项式注意力的自感知多空间特征组合 Transformer

计算机视觉与模式识别 2020-06-26 v1 计算与语言 神经与进化计算

摘要

视频描述基于两个基本概念:特征检测与特征组合。尽管现代 Transformer 有益于特征组合,但它们缺乏选择和理解内容的基本能力。随着特征长度增加,纳入能更好捕获相关内容的机制变得愈发重要。本工作中,我们引入了自感知组合 Transformer(SACT)的新概念,其能够生成多项式注意力(MultAtt),即生成各帧组合分布的一种方式。此外,多头注意力 Transformer 基于组合所有可能内容以进行注意力的原理,这利于自然语言分类,但对视频描述存在局限。视频内容存在重复,需要解析重要内容以实现更好的内容组合。本工作中,我们引入 SACT 以实现更具选择性的注意力,并将其组合用于不同注意力头,以更好地捕获可用于任意应用的内容。为解决多样化问题并鼓励选择性利用,我们提出自感知组合 Transformer 模型用于密集视频描述,并将该技术应用于 ActivityNet 与 YouCookII 两个基准数据集。

关键词

引用

@article{arxiv.2006.14262,
  title  = {SACT: Self-Aware Multi-Space Feature Composition Transformer for Multinomial Attention for Video Captioning},
  author = {Chiranjib Sur},
  journal= {arXiv preprint arXiv:2006.14262},
  year   = {2020}
}