中文

EmoGen:消除情感音乐生成中的主观偏差

声音 2023-07-06 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

音乐用于传达情感,因此生成情感音乐在自动音乐生成中十分重要。先前关于情感音乐生成的工作直接使用标注的情感标签作为控制信号,这受到主观偏差的困扰:不同人可能对同一音乐标注不同情感,且同一个人在不同情境下可能感受到不同情感。因此,以端到端方式直接将情感标签映射到音乐序列会混淆学习过程,并阻碍模型生成具有普遍情感的音乐。本文中,我们提出 EmoGen,一种情感音乐生成系统,其利用一组情感相关的音乐属性作为情感与音乐之间的桥梁,并将生成分为两个阶段:基于监督聚类的情感到属性映射,以及基于自监督学习的属性到音乐生成。两个阶段均有裨益:在第一阶段,聚类中心周围的属性值代表这些样本的普遍情感,有助于消除情感标签主观偏差的影响;在第二阶段,生成完全与情感标签解耦,从而免受主观偏差影响。主观与客观评估均表明,EmoGen 在情感控制准确率和音乐质量上分别优于先前方法,证明了我们在情感音乐生成上的优越性。EmoGen 生成的音乐样本可通过此链接获取:https://ai-muzic.github.io/emogen/,代码可通过此链接获取:https://github.com/microsoft/muzic/。

关键词

引用

@article{arxiv.2307.01229,
  title  = {EmoGen: Eliminating Subjective Bias in Emotional Music Generation},
  author = {Chenfei Kang and Peiling Lu and Botao Yu and Xu Tan and Wei Ye and Shikun Zhang and Jiang Bian},
  journal= {arXiv preprint arXiv:2307.01229},
  year   = {2023}
}

备注

12 pages, 7 pages