一种利用图像描述进行视觉叙事的分层方法
计算机视觉与模式识别
2019-09-30 v1 计算与语言
机器学习
机器学习
摘要
视觉叙事的主要挑战之一是开发能够在长事件序列上保持故事上下文以生成类人故事的技术。本文中,我们提出一种基于编码器-解码器网络的分层深度学习架构来解决该问题。为更好地帮助我们的网络在生成长且多样的句子的同时保持上下文,我们将自然语言图像描述与图像本身结合以生成每个故事句子。我们在 Visual Storytelling(VIST)数据集上评估我们的系统,并表明我们的方法在一组不同自动评估度量上优于最先进技术。该评估的经验结果证明了我们所提架构各组成部分的必要性,并展示了该架构在视觉叙事上的有效性。
引用
@article{arxiv.1909.12401,
title = {A Hierarchical Approach for Visual Storytelling Using Image Description},
author = {Md Sultan Al Nahian and Tasmia Tasrin and Sagar Gandhi and Ryan Gaines and Brent Harrison},
journal= {arXiv preprint arXiv:1909.12401},
year = {2019}
}
备注
Accepted at the 2019 International Conference on Interactive Digital Storytelling (ICIDS 2019)