MAST:基于三模态层次注意力的多模态抽取式摘要模型
计算与语言
2020-10-19 v1 计算机视觉与模式识别
机器学习
多媒体
摘要
本文提出 MAST,一种用于多模态抽取式文本摘要的新模型,该模型利用多模态视频中全部三种模态——文本、音频和视频——的信息。先前关于多模态抽取式文本摘要的工作仅利用了文本和视频模态的信息。我们考察了从音频模态提取信息的效用与挑战,并提出了一种序列到序列的、基于三模态层次注意力的模型,该模型通过让模型更多地关注文本模态来克服这些挑战。在用于多模态语言理解的 How2 数据集上,MAST 在 Content F1 分数上比当前最优的视频-文本模型高出 2.51 分,在 Rouge-L 分数上高出 1.00 分。
引用
@article{arxiv.2010.08021,
title = {MAST: Multimodal Abstractive Summarization with Trimodal Hierarchical Attention},
author = {Aman Khullar and Udit Arora},
journal= {arXiv preprint arXiv:2010.08021},
year = {2020}
}
备注
To appear in the first EMNLP Workshop on NLP Beyond Text, 2020. Aman Khullar and Udit Arora have equal contribution