多模态视频章节生成
计算机视觉与模式识别
2022-09-27 v1 人工智能
摘要
章节生成如今成为在线视频的实用技术。章节断点使用户能快速找到所需部分并获取概要标注。然而,该任务尚无公开的方法与数据集。为推动此方向的研究,我们引入一个名为 Chapter-Gen 的新数据集,其由约 1 万条带标注章节信息的用户生成视频组成。我们的数据收集流程快速、可扩展且不需要任何额外人工标注。在此数据集基础上,我们针对视频章节生成任务设计了一个有效基线,其捕捉视频的两个方面,包括视觉动态与解说文本。它解耦局部与全局视频特征,分别用于定位与标题生成。为高效解析长视频,设计了跳跃滑动窗口机制以定位潜在章节。并开发了交叉注意力多模态融合模块以聚合局部特征用于标题生成。我们的实验表明,所提框架取得了优于现有方法的性能,说明即便经微调,为相似任务设计的方法也无法直接迁移。代码与数据集见于 https://github.com/czt117/MVCG。
引用
@article{arxiv.2209.12694,
title = {Multi-modal Video Chapter Generation},
author = {Xiao Cao and Zitan Chen and Canyu Le and Lei Meng},
journal= {arXiv preprint arXiv:2209.12694},
year = {2022}
}