基于视频的音乐生成
机器学习
2026-02-10 v1 人工智能
计算机视觉与模式识别
多媒体
声音
摘要
随着互联网视频内容的快速增长,找到合适的配乐仍是一个重大挑战。本论文提出 EMSYNC(EMotion and SYNChronization),一个快速、免费且自动化的解决方案,可为输入视频生成量身定制的音乐,使内容创作者无需创作或授权音乐即可提升其作品。我们的模型生成与视频情绪和节奏同步的音乐。EMSYNC 的核心组件是一种新型视频情绪分类器。通过利用预训练深度神经网络进行特征提取并仅训练融合层,保持其冻结,我们在降低计算复杂度的同时提高了准确率。我们通过在 Ekman-6 和 MovieNet 上获得最先进结果,展示了方法的泛化能力。另一项关键贡献是构建了一个大规模情绪标注的 MIDI 数据集,用于情感音乐生成。我们随后提出一种情绪基准的 MIDI 生成器——首次在连续情绪值(而非离散类别)上进行条件生成,实现与复杂情绪内容相匹配的细粒度音乐生成。为增强时间同步,我们引入一种新颖的时间边界条件方法,称为“边界偏移编码”,将音乐和弦与场景变化对齐。将视频情绪分类、情绪导演音乐生成和时间边界条件相结合,EMSYNC 成为一个完全自动化的视频基音乐生成器。用户研究表明,它在音乐丰富性、情绪对齐、时间同步和整体偏好方面 consistently 优于现有方法,为视频基音乐生成树立了新的最先进水平。
引用
@article{arxiv.2602.07063,
title = {Video-based Music Generation},
author = {Serkan Sulun},
journal= {arXiv preprint arXiv:2602.07063},
year = {2026}
}
备注
PhD thesis, University of Porto