中文

Hide-and-Tell:学习桥接照片流以进行视觉叙事

计算机视觉与模式识别 2020-02-04 v1

摘要

视觉叙事是基于照片流创作短篇故事的任务。与现有的视觉描述不同,叙事旨在不仅包含事实性描述,还包含类人的叙述与语义。然而,VIST 数据集每个故事仅包含少量固定数量的照片。因此,视觉叙事的主要挑战是用叙述性和富有想象力的故事填补照片之间的视觉空白。在本文中,我们提出显式地学习想象一条桥接视觉空白的故事线。在训练过程中,从输入栈中随机省略一张或多张照片,并训练网络即使缺失照片也能生成完整合理的故事。此外,我们为视觉叙事提出了一种 hide-and-tell 模型,旨在学习照片流间的非局部关系,并改进和提升传统的基于 RNN 的模型。在实验中,我们表明我们的 hide-and-tell 方案及网络设计确实对叙事有效,并且我们的模型在自动指标上优于以往的 state-of-the-art 方法。最后,我们定性地展示了所学习到的在视觉空白上插值故事线的能力。

关键词

引用

@article{arxiv.2002.00774,
  title  = {Hide-and-Tell: Learning to Bridge Photo Streams for Visual Storytelling},
  author = {Yunjae Jung and Dahun Kim and Sanghyun Woo and Kyungsu Kim and Sungjin Kim and In So Kweon},
  journal= {arXiv preprint arXiv:2002.00774},
  year   = {2020}
}

备注

AAAI 2020 paper