中文

视觉与语言:从视觉感知到内容生成

计算机视觉与模式识别 2020-04-01 v1

摘要

视觉与语言是人类智能的两种基本能力。人类通常通过视觉与语言之间的交互来执行任务,支撑了谈论所见或依据自然语言描述幻画出图像这一独特人类能力。语言如何与视觉交互这一合理问题促使我们研究者拓展计算机视觉领域的边界。特别地,“视觉到语言”可能是过去五年中最热门的话题之一,出版物数量与广泛应用(如图像描述、视觉问答、视觉对话、语言导航等)均显著增长。此类任务以更全面的理解与多样的语言表征增强了视觉感知。超越“视觉到语言”的进展,语言亦有助于视觉理解并带来视觉内容生成的新可能,即“语言到视觉”。该过程如同一面棱镜,依据语言输入来创建视觉内容。本文综述沿这两个维度的最新进展:“视觉到语言”与“语言到视觉”。更具体地,前者主要关注图像/视频描述的发展,以及典型的编码器-解码器结构与基准,后者总结了视觉内容生成的技术。文中亦阐述了视觉与语言在现实世界中的部署或服务。

关键词

引用

@article{arxiv.1912.11872,
  title  = {Vision and Language: from Visual Perception to Content Creation},
  author = {Tao Mei and Wei Zhang and Ting Yao},
  journal= {arXiv preprint arXiv:1912.11872},
  year   = {2020}
}