用于图像引导故事结尾生成的多模态事件Transformer
计算机视觉与模式识别
2023-01-30 v1 计算与语言
摘要
图像引导故事结尾生成(IgSEG)旨在基于给定的故事情节和结尾图像生成故事结尾。现有方法侧重于跨模态特征融合,却忽略了从故事情节和结尾图像中进行推理与挖掘隐含信息。为应对这一缺陷,我们提出了一种多模态事件 Transformer,一种基于事件的 IgSEG 推理框架。具体而言,我们从故事情节和结尾图像构建视觉与语义事件图,并利用基于事件的推理在单一模态内推理并挖掘隐含信息。接下来,我们连接视觉与语义事件图,并利用跨模态融合整合不同模态的特征。此外,我们提出一种多模态注入器以自适应地将关键信息传递给解码器。除此之外,我们提出了一种不连贯检测来增强模型对故事情节上下文的理解以及图建模的鲁棒性。实验结果表明,我们的方法在图像引导故事结尾生成上取得了最先进的性能。
引用
@article{arxiv.2301.11357,
title = {Multimodal Event Transformer for Image-guided Story Ending Generation},
author = {Yucheng Zhou and Guodong Long},
journal= {arXiv preprint arXiv:2301.11357},
year = {2023}
}
备注
EACL 2023