VMSMO:学习为基于视频的新闻文章生成多模态摘要
计算与语言
2020-10-13 v1 计算机视觉与模式识别
摘要
当今一种流行的多媒体新闻形式是向用户提供生动的视频和相应的新闻文章,这被包括CNN、BBC在内的有影响力的新闻媒以及包括Twitter和微博在内的社交媒体所采用。在此情形下,自动选择视频的合适封面帧并生成文章的恰当文本摘要,可帮助编辑节省时间,并帮助读者更有效地做出决策。因此,本文提出基于视频的多模态输出多模态摘要(VMSMO)任务来解决该问题。该任务的主要挑战在于联合建模视频的时间依赖性与文章的语义含义。为此,我们提出基于双重交互的多模态摘要器(DIMS),由双重交互模块和多模态生成器组成。在双重交互模块中,我们提出捕获视频内局部语义信息的条件自注意力机制,以及从高层处理新闻文本与视频之间语义关系的全局注意力机制。在大规模真实世界VMSMO数据集上进行的广泛实验表明,DIMS在自动指标和人工评估方面均达到了最先进的性能。
引用
@article{arxiv.2010.05406,
title = {VMSMO: Learning to Generate Multimodal Summary for Video-based News Articles},
author = {Mingzhe Li and Xiuying Chen and Shen Gao and Zhangming Chan and Dongyan Zhao and Rui Yan},
journal= {arXiv preprint arXiv:2010.05406},
year = {2020}
}
备注
Accepted by The 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP 2020)