情境化、展示与讲述:一种神经视觉说故事模型
计算与语言
2018-06-05 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
我们提出了一种从图像序列生成短故事的神经模型,其扩展了Vinyals等人(Vinyals et al., 2015)的图像描述模型。该扩展依赖于一个编码器LSTM,从图像序列计算每篇故事的上下文向量。该上下文向量被用作多个独立解码器LSTM的初始状态,每个解码器LSTM通过以图像嵌入作为首输入,生成序列中对应每幅图像的故事片段。我们的模型在2018年视觉说故事挑战赛内部赛道上以METEOR指标和人工评分展现了具有竞争力的结果。
引用
@article{arxiv.1806.00738,
title = {Contextualize, Show and Tell: A Neural Visual Storyteller},
author = {Diana Gonzalez-Rico and Gibran Fuentes-Pineda},
journal= {arXiv preprint arXiv:1806.00738},
year = {2018}
}