中文

面向语言与视觉跨模态任务的Transformer架构:视角与展望

计算机视觉与模式识别 2021-11-10 v2 计算与语言

摘要

Transformer架构给多年来由循环神经网络主导的计算语言学领域带来了根本性变革。其成功也意味着语言与视觉跨模态任务的剧烈变化,许多研究者已着手应对该问题。本文中,我们回顾该领域若干最关键的里程碑,以及Transformer架构如何被纳入视觉语言跨模态任务的总体趋势。此外,我们讨论其当前局限,并推测一些我们认为迫近的展望。

关键词

引用

@article{arxiv.2103.04037,
  title  = {Perspectives and Prospects on Transformer Architecture for Cross-Modal Tasks with Language and Vision},
  author = {Andrew Shin and Masato Ishii and Takuya Narihira},
  journal= {arXiv preprint arXiv:2103.04037},
  year   = {2021}
}

备注

Accepted for publication by International Journal of Computer Vision (IJCV)