基于视觉 Transformer 的将一组图像描述为故事模型
计算机视觉与模式识别
2023-07-17 v3 人工智能
计算与语言
摘要
视觉讲故事(Visual Story-Telling)是从一组图像中生成多句故事的过程。恰当地纳入输入图像中所捕获的视觉变化与上下文信息,是视觉讲故事最具挑战性的方面之一。因此,从一组图像开发出的故事往往缺乏连贯性、相关性与语义关联。本文提出一种新颖的基于视觉 Transformer 的将一组图像描述为故事模型。所提方法使用视觉 Transformer(ViT)提取输入图像的独特特征。首先,输入图像被划分为 16X16 的图像块,并捆绑为展平图像块的线性投影。从单幅图像到多个图像块的变换捕获了输入视觉模式的视觉多样性。这些特征被用作序列编码器中双向 LSTM(Bidirectional-LSTM)的输入,从而捕获所有图像块的过去与未来图像上下文。然后,实现一种注意力机制并用于提升输入语言模型(即 Mogrifier-LSTM)的数据判别能力。我们使用视觉讲故事数据集(VIST)评估所提模型的性能,结果表明我们的模型优于当前最先进的模型。
引用
@article{arxiv.2210.02762,
title = {Vision Transformer Based Model for Describing a Set of Images as a Story},
author = {Zainy M. Malakan and Ghulam Mubashar Hassan and Ajmal Mian},
journal= {arXiv preprint arXiv:2210.02762},
year = {2023}
}
备注
This paper has been accepted at the 35th Australasian Joint Conference on Artificial Intelligence 2022 (Camera-ready version is attached)