通过神经音频编解码器实现的表达性鼓格鼓声合成
声音
2026-05-12 v1 人工智能
摘要
从符号表示直接生成逼真的鼓声是音感与机器学习交叉中的一个挑战性任务。我们提出了一个系统,将表达性鼓格(时间对齐的 MIDI 表示,包含微timing 和 velocity 信息)转换为鼓声,通过预测神经音频编解码器的离散代码来实现。我们的方法使用基于 Transformer 的模型将鼓格输入映射到编码器标记序列,这些标记随后通过预训练的编解码器解码器转换为波形音频。我们实验了多种最新的神经音频编解码器,即 EnCodec、DAC 和 X-Codec,以评估音频表示选择对生成鼓声质量的影响。该系统在 Expanded Groove MIDI Dataset(E-GMD)上进行训练和评估,该数据集包含大量人类鼓演奏的配对 MIDI 与音频。我们使用客观指标评估生成音频的保真度和音乐对齐性。总体而言,我们的结果表明,编码器标记预测是鼓格到音频生成的有效途径,并为选择 percussive 合成的音频标记器提供了实用见解。
引用
@article{arxiv.2605.10281,
title = {Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs},
author = {Konstantinos Soiledis and Maximos Kaliakatsos-Papakostas and Dimos Makris and Konstantinos Tsamis},
journal= {arXiv preprint arXiv:2605.10281},
year = {2026}
}