中文

从展示到讲述:基于深度学习的图像描述综述

计算机视觉与模式识别 2021-12-02 v3 计算与语言

摘要

连接视觉与语言在生成式智能中起着至关重要的作用。因此,大量研究工作致力于图像描述,即用句法和语义上有意义的句子描述图像。自 2015 年起,该任务通常通过由视觉编码器和用于文本生成的语言模型组成的流水线来解决。多年来,这两个组件通过利用目标区域、属性、引入多模态连接、全注意力方法以及类 BERT 的早期融合策略而得到了显著演进。然而,尽管结果令人印象深刻,图像描述的研究尚未得出结论性答案。本工作旨在提供图像描述方法的全面概览,从视觉编码和文本生成到训练策略、数据集与评估指标。就此而言,我们对许多相关的 state-of-the-art 方法进行了定量比较,以识别架构与训练策略中最具影响的技术创新。此外,还讨论了该问题的许多变体及其开放挑战。本工作的最终目标是作为理解现有文献并突出未来研究方向的工具,在计算机视觉与自然语言处理可找到最优协同的研究领域中。

关键词

引用

@article{arxiv.2107.06912,
  title  = {From Show to Tell: A Survey on Deep Learning-based Image Captioning},
  author = {Matteo Stefanini and Marcella Cornia and Lorenzo Baraldi and Silvia Cascianelli and Giuseppe Fiameni and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2107.06912},
  year   = {2021}
}