通过预测故事中的锚词嵌入进行视觉叙事
计算机视觉与模式识别
2020-01-15 v1
摘要
我们提出了一种用于视觉叙事任务的学习模型。主要思想是从图像中预测锚词嵌入,并利用嵌入和图像特征联合生成叙述句子。我们使用从真实故事中随机采样的名词的嵌入作为目标锚词嵌入来学习预测器。为了叙述一系列图像,我们使用预测的锚词嵌入和图像特征作为 seq2seq 模型的联合输入。与最先进的方法相反,所提出的模型设计简单、易于优化,并在大多数自动评估指标上取得了最佳结果。在人类评估中,该方法也优于竞争方法。
引用
@article{arxiv.2001.04541,
title = {Visual Storytelling via Predicting Anchor Word Embeddings in the Stories},
author = {Bowen Zhang and Hexiang Hu and Fei Sha},
journal= {arXiv preprint arXiv:2001.04541},
year = {2020}
}
备注
Accepted by ICCV19 CLVL workshop: 3rd Workshop on Closing the Loop Between Vision and Language