MIDI-DDSP:基于分层建模的音乐演奏精细控制
声音
2022-03-21 v2 机器学习
音频与语音处理
摘要
音乐表达需要对演奏的音符及其表演方式加以控制。传统音频合成器提供精细的表达控制,但牺牲了真实感。黑盒神经音频合成与拼接采样器可生成真实音频,但缺乏控制机制。本工作中,我们提出MIDI-DDSP——一种乐器分层模型,兼具真实神经音频合成与细致用户控制能力。从可解释的微分数字信号处理(DDSP)合成参数出发,我们推断音符及其表现性演奏的高层属性(如音色、颤音、力度与运音法)。这构建了三层层级(音符、演奏、合成),使个体可选择在任一层干预,或利用训练所得先验(给定音符的演奏、给定演奏的合成)获得创作辅助。通过定量实验与听感测试,我们证明该层级能重建高保真音频、准确预测音符序列的演奏属性、独立操控给定演奏的属性,并作为完整系统从全新音符序列生成真实音频。借助具多粒度层级的可解释结构,MIDI-DDSP为赋能不同音乐经验个体的辅助工具打开了大门。
引用
@article{arxiv.2112.09312,
title = {MIDI-DDSP: Detailed Control of Musical Performance via Hierarchical Modeling},
author = {Yusong Wu and Ethan Manilow and Yi Deng and Rigel Swavely and Kyle Kastner and Tim Cooijmans and Aaron Courville and Cheng-Zhi Anna Huang and Jesse Engel},
journal= {arXiv preprint arXiv:2112.09312},
year = {2022}
}
备注
Accepted by International Conference on Learning Representations (ICLR) 2022