中文

CISum:学习跨模态交互以增强多模态摘要的多模态语义覆盖

人工智能 2023-02-21 v1

摘要

多模态摘要(MS)旨在从多模态输入生成摘要。以往工作主要关注ROUGE等文本语义覆盖指标,将视觉内容视为补充数据。因此,摘要难以有效覆盖不同模态的语义。本文提出一种多任务跨模态学习框架(CISum),通过学得多模态文章中的跨模态交互来提升多模态语义覆盖。为获取视觉语义,我们基于与文本内容的关联性将图像转化为视觉描述。随后,将视觉描述与文本内容融合以生成文本摘要,从而捕获多模态内容的语义,并选取最相关图像作为视觉摘要。此外,我们设计了一种自动多模态语义覆盖指标来评估性能。实验结果表明,CISum在多模态语义覆盖指标上优于基线方法,同时保持了ROUGE和BLEU的优异性能。

关键词

引用

@article{arxiv.2302.09934,
  title  = {CISum: Learning Cross-modality Interaction to Enhance Multimodal Semantic Coverage for Multimodal Summarization},
  author = {Litian Zhang and Xiaoming Zhang and Ziming Guo and Zhipeng Liu},
  journal= {arXiv preprint arXiv:2302.09934},
  year   = {2023}
}

备注

accepted by SIAM SDM2023