TripleSumm:面向视频摘要的自适应三模态融合
计算机视觉与模式识别
2026-03-03 v1 人工智能
机器学习
摘要
视频内容的指数级增长 necessitates effective video summarization to efficiently extract key information from long videos。然而,当前方法难以充分理解复杂视频,主要因为采用静态或模态无关的融合策略。这些方法未能考虑视频数据中固有的模态灵敏度在帧层面的动态变化。为克服这些限制,我们提出 TripleSumm,一种在帧级别自适应加权和融合视觉、文本和音频模态贡献的新型架构。此外, multimodal video summarization research 的一个重要瓶颈是缺乏全面的基准测试。为解决这一瓶颈,我们引入 MoSu (Most Replayed Multimodal Video Summarization),首个提供三种模态的大规模基准测试。广泛的实验表明,TripleSumm 实现了最先进的性能,在四个基准测试中均显著优于现有方法。我们的代码和数据集已提供。
引用
@article{arxiv.2603.01169,
title = {TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization},
author = {Sumin Kim and Hyemin Jeong and Mingu Kang and Yejin Kim and Yoori Oh and Joonseok Lee},
journal= {arXiv preprint arXiv:2603.01169},
year = {2026}
}
备注
Published as a Conference Paper at ICLR 2026