通过跨模态Transformer和门控注意力实现视觉基础的多模态摘要
人工智能
2026-05-13 v1
摘要
多模态摘要要求模型联合理解文本和视觉输入,以生成简洁、语义连贯的摘要。现有方法通常将浅层视觉特征注入深层语言模型,导致表征不匹配和跨模态基础薄弱。我们提出了一个统一框架,同时执行文本摘要和代表性图像选择。我们的系统,SPeCTrA-Sum(带有跨模态Transformer和门控注意力的采样器感知器用于摘要),引入了两项关键创新。首先,一个深度视觉处理器(DVP)在相应深度将视觉编码器与语言模型对齐,实现层次化、逐层的融合,以保持语义一致性。其次,一个轻量级的视觉相关性预测器(VRP)通过从行列式点过程(DPP)教师模型中蒸馏软标签来选择显著且多样的图像。SPeCTrA-Sum使用多目标损失进行训练,该损失结合了自回归摘要、跨模态对齐和基于DPP的蒸馏。实验表明,我们的系统能生成更准确、视觉基础更扎实的摘要,并选择更具代表性的图像,证明了深度感知融合和原则性图像选择在多模态摘要中的优势。
引用
@article{arxiv.2605.11753,
title = {Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention},
author = {Abid Ali and Diego Molla-Aliod and Usman Naseem},
journal= {arXiv preprint arXiv:2605.11753},
year = {2026}
}
备注
Accepted to Findings of ACL 2026