MF2Summ:基于时间对齐的多模态融合视频摘要
计算机视觉与模式识别
2025-06-13 v1
摘要
在线视频内容的快速增长使得有效的视频摘要技术成为必要。传统方法往往仅依赖单一模态(通常是视觉),难以捕捉视频的完整语义丰富性。本文引入了MF2Summ,一种基于多模态内容理解的新颖视频摘要模型,集成了视觉和听觉信息。MF2Summ采用五阶段流程:特征提取、跨模态注意力交互、特征融合、片段预测和关键镜头选择。视觉特征使用预训练的 GoogLeNet 模型提取,听觉特征使用 SoundNet 提取。我们融合机制的核心涉及跨模态Transformer和基于对齐引导的自注意力Transformer,旨在有效地建模跨模态依赖性和时间对应关系。预测片段的重要性、位置和中心性,然后使用非最大抑制(NMS)和Kernel时序分割(KTS)算法进行关键镜头选择。在SumMe和TVSum数据集上的实验结果表明,MF2Summ实现了竞争性能,显著将DSNet模型的F1分数提高了1.9%和0.6%,并在其他最先进的方法中表现优异。
引用
@article{arxiv.2506.10430,
title = {MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment},
author = {Shuo wang and Jihao Zhang},
journal= {arXiv preprint arXiv:2506.10430},
year = {2025}
}