中文

何时何地切割古典音乐会?一种多模态自动视频编辑方法

计算机视觉与模式识别 2025-10-08 v1 多媒体

摘要

在计算机视觉和多媒体领域中,自动视频编辑仍是一个较少探索的任务,尤其是与日益增长的视频生成和场景理解兴趣相比。在本文中,我们针对具体挑战——古典音乐会的多摄像机录像的编辑——将问题分解为两个关键子任务:何时切割以及如何切割。在最新文献基础上,我们提出了一种新型多模态架构用于时间分割任务(何时切割),该架构整合了来自音频信号的 log-梅尔频谱图,以及可选的图像嵌入和标量时间特征,通过轻量级卷积-变换器管道实现。对于空间选择任务(如何切割),我们通过更新主干网络(如 ResNet)为 CLIP 基编码器,并约束干扰选择为来自同一音乐会的片段。我们采用伪标记方法构建数据集,即原始视频数据被自动聚类为连贯的拍摄片段。我们表明我们的模型在检测切割点方面超越了先前的基线,并在提供竞争性视觉拍摄选择方面取得佳绩,推动了多模态自动视频编辑领域的技术进步。

关键词

引用

@article{arxiv.2510.05661,
  title  = {When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach},
  author = {Daniel Gonzálbez-Biosca and Josep Cabacas-Maso and Carles Ventura and Ismael Benito-Altamirano},
  journal= {arXiv preprint arXiv:2510.05661},
  year   = {2025}
}