中文

学习音乐音频中音色与音高的解耦表示

声音 2018-11-09 v1 音频与语音处理

摘要

音色与音高是音乐声音的两个主要感知属性。根据目标应用的不同,我们有时更倾向于关注其中之一,同时削弱另一者的影响。研究者已利用领域知识与信号处理技术手工设计出此类音色不变或音高不变特征,但在所得特征表示中仍难以将二者解耦。借鉴表示学习中的前沿技术,本文提出两种深度卷积神经网络模型,用于学习音乐音色与音高的解耦表示。两种模型均使用编码器/解码器与对抗训练来学习音乐表示,但第二种模型额外使用跳跃连接来处理音高信息。由于音乐是时间的艺术,两模型通过从 MuseScore 收集的新数据集以帧级乐器与音高标签进行监督。我们以称为“音色交叉”的新评估协议比较两种解耦模型的结果,这引发了音频域音乐编辑中有趣的应用。通过多种客观评估,我们表明第二种模型能更好地在不显著影响音高结构的情况下更改多乐器乐曲的配器。通过解耦音色与音高,我们预期该模型亦有助于生成更逼真的音乐音频。

关键词

引用

@article{arxiv.1811.03271,
  title  = {Learning Disentangled Representations for Timber and Pitch in Music Audio},
  author = {Yun-Ning Hung and Yi-An Chen and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:1811.03271},
  year   = {2018}
}