中文

看、听、读:利用引导注意力多模态进行抽象文本摘要

机器学习 2021-09-16 v2 计算与语言

摘要

近年来,带有多模态输入的抽象文本摘要因其能够从不同源模态中汇聚信息并生成流畅的文本摘要而开始受到关注。然而,现有方法使用短视频作为视觉模态、短摘要作为真值,因此在长视频和长真值摘要上表现不佳。此外,目前不存在可将此任务推广到不同长度视频的基准数据集。本文中,我们引入了 AVIATE,这是首个面向多样时长视频抽象文本摘要的大规模数据集,由 NDSS、ICML、NeurIPS 等知名学术会议的报告整理而成。我们使用相应研究论文的摘要作为参考摘要,从而确保真值的质量充足且统一。随后我们提出 FLORAL,一种基于因子化多模态 Transformer 的仅解码器语言模型,其固有地捕捉各输入模态内及模态间的动态关系以完成文本摘要任务。FLORAL 利用递增数量的自注意力来捕捉多模态,表现显著优于传统的编码器-解码器网络。大量实验表明,在现有面向短视频的 How2 数据集与新引入的面向多样时长视频的 AVIATE 数据集上,FLORAL 在定性与定量评估中均较基线取得显著提升,分别在两个数据集上以 1.391.392.742.74 个 ROUGE-L 点超越最佳基线。

关键词

引用

@article{arxiv.2105.09601,
  title  = {See, Hear, Read: Leveraging Multimodality with Guided Attention for Abstractive Text Summarization},
  author = {Yash Kumar Atri and Shraman Pramanick and Vikram Goyal and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2105.09601},
  year   = {2021}
}

备注

Journal paper accepted in Knowledge Based Systems