中文

CFSum:一种用于多模态摘要的由粗到细贡献网络

计算与语言 2023-07-07 v1 计算机视觉与模式识别

摘要

多模态摘要通常受到视觉模态贡献不明确的问题的困扰。现有的多模态摘要方法侧重于设计不同模态的融合方法,而忽略了视觉模态有用的自适应条件。因此,我们提出了一种新颖的用于多模态摘要的由粗到细贡献网络(CFSum)来考虑图像对摘要的不同贡献。首先,为消除无用图像的干扰,我们提出了一个预过滤模块以舍弃无用图像。其次,为准确利用有用图像,我们提出了两个层次的视觉补充模块,即词级和短语级。具体而言,计算图像贡献并将其用于引导文本和视觉模态的注意力。实验结果表明,CFSum 在标准基准上显著优于多个强基线。此外,分析证实有用图像甚至可以帮助生成图像中隐式表示的非视觉词。

关键词

引用

@article{arxiv.2307.02716,
  title  = {CFSum: A Coarse-to-Fine Contribution Network for Multimodal Summarization},
  author = {Min Xiao and Junnan Zhu and Haitao Lin and Yu Zhou and Chengqing Zong},
  journal= {arXiv preprint arXiv:2307.02716},
  year   = {2023}
}

备注

acl2023