面向多模态摘要的段落级视觉-语言语义对齐建模
计算与语言
2023-05-11 v3 计算机视觉与模式识别
摘要
当前多数多模态摘要方法遵循级联方式,即先使用现成目标检测器提取视觉特征,再将这些特征与语言表示融合,通过编码器-解码器模型生成摘要。该级联方式无法捕获图像与段落间的语义对齐,而对精确摘要而言这至关重要。本文提出 ViL-Sum,联合建模段落级\textbf{视}觉-\textbf{语}言语义对齐与多模态\textbf{摘}要。ViL-Sum 的核心是一个带两个精心设计的任务(图像重排序与图像选择)的联合多模态编码器。该联合多模态编码器捕获模态间交互,其中重排序任务引导模型学习段落级语义对齐,选择任务引导模型在最终摘要中选取与摘要相关的图像。实验结果表明,我们提出的 ViL-Sum 显著优于当前最先进方法。在进一步分析中,我们发现两个精心设计的任务与联合多模态编码器能有效引导模型学习合理的段落-图像及摘要-图像关系。
引用
@article{arxiv.2208.11303,
title = {Modeling Paragraph-Level Vision-Language Semantic Alignment for Multi-Modal Summarization},
author = {Chenhao Cui and Xinnian Liang and Shuangzhi Wu and Zhoujun Li},
journal= {arXiv preprint arXiv:2208.11303},
year = {2023}
}