Music FaderNets:基于低级特征建模、通过高级特征实现可控音乐生成
音频与语音处理
2020-07-31 v1 机器学习
声音
机器学习
摘要
高级音乐特质(如情感)往往抽象、主观且难以量化。鉴于这些困难,利用监督学习技术学习良好的特征表示并不容易,这既可能因为标签不足,也可能因为人类标注标签的主观性(从而方差很大)。在本文中,我们提出一种框架,可通过先对其相应的可量化低级属性建模,以有限数据学习高级特征表示。我们将所提框架称为 Music FaderNets,其灵感来源于低级属性可通过特征解耦与隐空间正则化技术由独立的“滑动推子”连续操控。随后通过基于高斯混合变分自编码器(GM-VAEs)的半监督聚类,由低级表示推断高级特征。以 arousal(唤醒度)作为高级特征示例,我们展示了模型的“推子”是解耦的,并相对于生成输出音乐的建模低级属性线性变化。此外,我们证明该模型仅使用 1% 的训练集标注即成功学习了 arousal 与其相应低级属性(节奏与音符密度)之间的内在关系。最后,利用所学高级特征表示,我们探索了该框架在不同 arousal 状态间风格迁移任务中的应用。该方法的有效性通过主观听音测试得以验证。
引用
@article{arxiv.2007.15474,
title = {Music FaderNets: Controllable Music Generation Based On High-Level Features via Low-Level Feature Modelling},
author = {Hao Hao Tan and Dorien Herremans},
journal= {arXiv preprint arXiv:2007.15474},
year = {2020}
}