SKALD:面向连贯多镜头视频创建的基于学习的镜头组装
计算机视觉与模式识别
2025-08-19 v2 人工智能
摘要
我们提出了 SKALD,一种多镜头视频组装方法,能够在最小程度依赖文本的情况下,从候选镜头构建连贯的视频序列。我们方法的核心是学习片段组装分数,这是一种基于学习的度量,用于测量镜头之间的时间和语义关系,以量化叙事连贯性。我们使用由 LCA 分数引导的高效束搜索算法来解决组合多个镜头的指数级复杂度问题。为了在有限的人工标注下有效训练模型,我们为 LCA 编码器提出了两项任务:片段连贯性学习(使用对比学习区分连贯和不连贯的序列)和特征回归(将学习到的表示转换为实值连贯性分数)。我们开发了两个变体:仅依赖视觉连贯性的基础 SKALD 模型,以及在可用时集成辅助文本信息的 SKALD-text。在 VSPD 和我们精心整理的 MSV3C 数据集上的实验表明,SKALD 在 IoU 上实现了高达 48.6% 的提升,并且比 SOTA 方法提速 43%。一项用户研究进一步验证了我们的方法,45% 的参与者更倾向于 SKALD 组装的视频,而倾向于基于文本组装方法的参与者仅占 22%。
引用
@article{arxiv.2503.08010,
title = {SKALD: Learning-Based Shot Assembly for Coherent Multi-Shot Video Creation},
author = {Chen Yi Lu and Md Mehrab Tanjim and Ishita Dasgupta and Somdeb Sarkhel and Gang Wu and Saayan Mitra and Somali Chaterji},
journal= {arXiv preprint arXiv:2503.08010},
year = {2025}
}