通过对齐情感与时间边界生成视频音轨
声音
2026-02-06 v3 人工智能
机器学习
多媒体
音频与语音处理
图像与视频处理
摘要
为视频生成配乐仍是多媒体内容创作者面临的高成本和耗时问题。我们提出 EMSYNC,一种自动基于视频的符号音乐生成器,创建与视频情感内容和时间边界相匹配的音乐。其采用两阶段框架:预训练的视频情感分类器提取情感特征,条件音乐生成器则依据情感和时间线索生成 MIDI 序列。我们引入边界偏移量 (boundary offsets) 作为新的时间条件机制,使模型能够预见即将到来的视频场景切割,并将生成的音乐和弦与之对齐。我们还提出一种映射方案,将视频情感分类器的离散分类输出与情感条件 MIDI 生成器所需的连续价值-唤醒输入相结合,实现情感信息在不同表征之间的无缝集成。我们的方法在客观和主观评估中均优于当前最先进模型,展示了在情感和时间上与视频相匹配生成音乐的有效性。我们的演示和输出样本可在 https://serkansulun.com/emsync 查看。
引用
@article{arxiv.2502.10154,
title = {Video Soundtrack Generation by Aligning Emotions and Temporal Boundaries},
author = {Serkan Sulun and Paula Viana and Matthew E. P. Davies},
journal= {arXiv preprint arXiv:2502.10154},
year = {2026}
}
备注
IEEE Transactions on Multimedia, 2026, in print