CISum:学习跨模态交互以增强多模态摘要的多模态语义覆盖
人工智能
2023-02-21 v1
摘要
多模态摘要(MS)旨在从多模态输入生成摘要。以往工作主要关注ROUGE等文本语义覆盖指标,将视觉内容视为补充数据。因此,摘要难以有效覆盖不同模态的语义。本文提出一种多任务跨模态学习框架(CISum),通过学得多模态文章中的跨模态交互来提升多模态语义覆盖。为获取视觉语义,我们基于与文本内容的关联性将图像转化为视觉描述。随后,将视觉描述与文本内容融合以生成文本摘要,从而捕获多模态内容的语义,并选取最相关图像作为视觉摘要。此外,我们设计了一种自动多模态语义覆盖指标来评估性能。实验结果表明,CISum在多模态语义覆盖指标上优于基线方法,同时保持了ROUGE和BLEU的优异性能。
引用
@article{arxiv.2302.09934,
title = {CISum: Learning Cross-modality Interaction to Enhance Multimodal Semantic Coverage for Multimodal Summarization},
author = {Litian Zhang and Xiaoming Zhang and Ziming Guo and Zhipeng Liu},
journal= {arXiv preprint arXiv:2302.09934},
year = {2023}
}
备注
accepted by SIAM SDM2023