Video2Music:基于情感多模态Transformer模型从视频生成适配音乐
声音
2024-06-03 v2 人工智能
音频与语音处理
摘要
音乐生成领域的众多研究已展现出令人印象深刻的性能,但几乎尚无模型能直接生成与伴随视频相匹配的音乐。本工作中,我们开发了一个生成式音乐 AI 框架 Video2Music,可匹配所给视频。我们首先整理了一组独特的音乐视频集合。随后,我们分析这些音乐视频以获得语义、场景偏移、运动与情感特征。这些各异的特征被用作我们音乐生成模型的引导输入。我们将音频文件转写为 MIDI 与和弦,并提取如音符密度与响度等特征。这产生了一个丰富的多模态数据集 MuVi-Sync,我们在其上训练一种新颖的情感多模态Transformer(AMT)模型,以给定视频生成音乐。该模型包含一种新颖机制,用以强制视频与音乐间的情感相似性。最后,基于 biGRU 回归模型执行后处理,根据视频特征估计音符密度与响度。这确保了以变化节奏与音量对生成和弦的动态渲染。在充分实验中,我们展示了所提框架能生成在情感上与视频内容匹配的音乐。音乐质量及音乐-视频匹配质量在用户研究中得到确认。所提 AMT 模型及新 MuVi-Sync 数据集,为视频音乐生成这一新任务迈出了有前景的一步。
引用
@article{arxiv.2311.00968,
title = {Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model},
author = {Jaeyong Kang and Soujanya Poria and Dorien Herremans},
journal= {arXiv preprint arXiv:2311.00968},
year = {2024}
}