中文

通过跨模态Transformer和门控注意力实现视觉基础的多模态摘要

人工智能 2026-05-13 v1

摘要

多模态摘要要求模型联合理解文本和视觉输入,以生成简洁、语义连贯的摘要。现有方法通常将浅层视觉特征注入深层语言模型,导致表征不匹配和跨模态基础薄弱。我们提出了一个统一框架,同时执行文本摘要和代表性图像选择。我们的系统,SPeCTrA-Sum(带有跨模态Transformer和门控注意力的采样器感知器用于摘要),引入了两项关键创新。首先,一个深度视觉处理器(DVP)在相应深度将视觉编码器与语言模型对齐,实现层次化、逐层的融合,以保持语义一致性。其次,一个轻量级的视觉相关性预测器(VRP)通过从行列式点过程(DPP)教师模型中蒸馏软标签来选择显著且多样的图像。SPeCTrA-Sum使用多目标损失进行训练,该损失结合了自回归摘要、跨模态对齐和基于DPP的蒸馏。实验表明,我们的系统能生成更准确、视觉基础更扎实的摘要,并选择更具代表性的图像,证明了深度感知融合和原则性图像选择在多模态摘要中的优势。

关键词

引用

@article{arxiv.2605.11753,
  title  = {Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention},
  author = {Abid Ali and Diego Molla-Aliod and Usman Naseem},
  journal= {arXiv preprint arXiv:2605.11753},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026