中文

基于视觉 Transformer 的将一组图像描述为故事模型

计算机视觉与模式识别 2023-07-17 v3 人工智能 计算与语言

摘要

视觉讲故事(Visual Story-Telling)是从一组图像中生成多句故事的过程。恰当地纳入输入图像中所捕获的视觉变化与上下文信息,是视觉讲故事最具挑战性的方面之一。因此,从一组图像开发出的故事往往缺乏连贯性、相关性与语义关联。本文提出一种新颖的基于视觉 Transformer 的将一组图像描述为故事模型。所提方法使用视觉 Transformer(ViT)提取输入图像的独特特征。首先,输入图像被划分为 16X16 的图像块,并捆绑为展平图像块的线性投影。从单幅图像到多个图像块的变换捕获了输入视觉模式的视觉多样性。这些特征被用作序列编码器中双向 LSTM(Bidirectional-LSTM)的输入,从而捕获所有图像块的过去与未来图像上下文。然后,实现一种注意力机制并用于提升输入语言模型(即 Mogrifier-LSTM)的数据判别能力。我们使用视觉讲故事数据集(VIST)评估所提模型的性能,结果表明我们的模型优于当前最先进的模型。

关键词

引用

@article{arxiv.2210.02762,
  title  = {Vision Transformer Based Model for Describing a Set of Images as a Story},
  author = {Zainy M. Malakan and Ghulam Mubashar Hassan and Ajmal Mian},
  journal= {arXiv preprint arXiv:2210.02762},
  year   = {2023}
}

备注

This paper has been accepted at the 35th Australasian Joint Conference on Artificial Intelligence 2022 (Camera-ready version is attached)