中文

情境化、展示与讲述:一种神经视觉说故事模型

计算与语言 2018-06-05 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

我们提出了一种从图像序列生成短故事的神经模型,其扩展了Vinyals等人(Vinyals et al., 2015)的图像描述模型。该扩展依赖于一个编码器LSTM,从图像序列计算每篇故事的上下文向量。该上下文向量被用作多个独立解码器LSTM的初始状态,每个解码器LSTM通过以图像嵌入作为首输入,生成序列中对应每幅图像的故事片段。我们的模型在2018年视觉说故事挑战赛内部赛道上以METEOR指标和人工评分展现了具有竞争力的结果。

关键词

引用

@article{arxiv.1806.00738,
  title  = {Contextualize, Show and Tell: A Neural Visual Storyteller},
  author = {Diana Gonzalez-Rico and Gibran Fuentes-Pineda},
  journal= {arXiv preprint arXiv:1806.00738},
  year   = {2018}
}