由高层音色特征参数化的神经打击乐合成
音频与语音处理
2020-04-06 v2 机器学习
声音
机器学习
摘要
我们提出一种基于深度神经网络的方法来合成打击乐声音,并可控制声音的高层音色特征。该方法允许对合成器进行直观控制,使用户无需广博的信号处理知识即可塑造声音。我们使用基于前馈卷积神经网络的架构,能够将输入参数映射到相应波形。我们提出两个数据集,在受限语境及覆盖更宽声音频谱的语境下评估我们的方法。用作参数的音色特征取自信号处理近期文献。我们也使用这些特征对所提模型进行评估与验证,以确保改变输入参数会产生具有期望特征的相应波形。最后,我们通过主观听音测试评估输出声音质量。我们提供声音示例与系统源代码以保证可复现性。
引用
@article{arxiv.1911.11853,
title = {Neural Percussive Synthesis Parameterised by High-Level Timbral Features},
author = {António Ramires and Pritish Chandna and Xavier Favory and Emilia Gómez and Xavier Serra},
journal= {arXiv preprint arXiv:1911.11853},
year = {2020}
}