CFSum:一种用于多模态摘要的由粗到细贡献网络
计算与语言
2023-07-07 v1 计算机视觉与模式识别
摘要
多模态摘要通常受到视觉模态贡献不明确的问题的困扰。现有的多模态摘要方法侧重于设计不同模态的融合方法,而忽略了视觉模态有用的自适应条件。因此,我们提出了一种新颖的用于多模态摘要的由粗到细贡献网络(CFSum)来考虑图像对摘要的不同贡献。首先,为消除无用图像的干扰,我们提出了一个预过滤模块以舍弃无用图像。其次,为准确利用有用图像,我们提出了两个层次的视觉补充模块,即词级和短语级。具体而言,计算图像贡献并将其用于引导文本和视觉模态的注意力。实验结果表明,CFSum 在标准基准上显著优于多个强基线。此外,分析证实有用图像甚至可以帮助生成图像中隐式表示的非视觉词。
引用
@article{arxiv.2307.02716,
title = {CFSum: A Coarse-to-Fine Contribution Network for Multimodal Summarization},
author = {Min Xiao and Junnan Zhu and Haitao Lin and Yu Zhou and Chengqing Zong},
journal= {arXiv preprint arXiv:2307.02716},
year = {2023}
}
备注
acl2023