MusER:基于音乐元素正则化的情感符号音乐生成
声音
2024-01-03 v2 人工智能
多媒体
音频与语音处理
摘要
生成带有情感的音乐是自动音乐生成中的一项重要任务,其中情感通过多种随时间变化且相互协作的音乐元素(如音高和时长)来激发。然而,先前基于深度学习的情绪音乐生成研究很少探索不同音乐元素对情感的贡献,更不用说有意操纵这些元素来改变音乐的情感,这不利于对情感进行细粒度的元素级控制。为填补这一空白,我们提出了一种新颖的方法,在潜在空间中使用基于音乐元素的正则化来解耦不同元素,研究它们在区分情感中的作用,并进一步操纵元素以改变音乐情感。具体而言,我们提出了一种基于VQ-VAE的新模型,名为MusER。MusER引入正则化损失,强制音乐元素序列与潜在变量序列的特定维度之间建立对应关系,为解耦离散序列提供了新的解决方案。利用解耦后的潜在向量,我们设计了一种两级解码策略,包括多个解码器关注具有不同语义的潜在向量,以更好地预测元素。通过可视化潜在空间,我们得出结论:MusER产生了可解耦且可解释的潜在空间,并深入了解了不同元素对情感维度(即唤醒度和效价)的贡献。实验结果表明,在客观和主观评价中,MusER在生成情感音乐方面均优于现有最先进模型。此外,我们通过元素转移重新编排音乐,并尝试通过转移情感可区分元素来改变音乐的情感。
引用
@article{arxiv.2312.10307,
title = {MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion},
author = {Shulei Ji and Xinyu Yang},
journal= {arXiv preprint arXiv:2312.10307},
year = {2024}
}
备注
Accepted by AAAI 2024