对齐与注意力:基于双对比损失的多模态摘要方法
计算机视觉与模式识别
2023-06-14 v3
摘要
多模态摘要的目标是从不同模态中提取最重要的信息以形成输出摘要。与单模态摘要不同,多模态摘要任务显式地利用跨模态信息来帮助生成更可靠且高质量的摘要。然而,现有方法未能利用不同模态之间的时间对应关系,且忽略了不同样本之间的内在关联。为解决此问题,我们引入了 Align and Attend Multimodal Summarization(A2Summ),一种统一的基于多模态 transformer 的模型,能够有效对齐并关注多模态输入。此外,我们提出了两种新颖的对比损失来建模样本间与样本内的关联。在两个标准视频摘要数据集(TVSum 和 SumMe)以及两个多模态摘要数据集(Daily Mail 和 CNN)上的大量实验证明了 A2Summ 的优越性,在所有数据集上均取得了最先进的性能。此外,我们收集了一个大规模多模态摘要数据集 BLiSS,其包含带有标注摘要的直播视频与转写文本。我们的代码与数据集公开于 ~\url{https://boheumd.github.io/A2Summ/}。
引用
@article{arxiv.2303.07284,
title = {Align and Attend: Multimodal Summarization with Dual Contrastive Losses},
author = {Bo He and Jun Wang and Jielin Qiu and Trung Bui and Abhinav Shrivastava and Zhaowen Wang},
journal= {arXiv preprint arXiv:2303.07284},
year = {2023}
}
备注
Accepted at CVPR 2023