中文

结合乐器特定输入表示与扩散外绘的表现性木吉他音色合成

声音 2024-01-25 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

由于复音性和表现力的高变异性,合成演奏的吉他声音是一项极具挑战性的任务。近期,深度生成模型在从乐谱合成表现性复音乐器声音方面展现出可喜的结果,通常使用通用的 MIDI 输入。在本工作中,我们提出了一种表现性木吉他音色合成模型,其具有针对该乐器的定制输入表示,我们称之为 guitarroll。我们使用基于扩散的外绘方法实现了所提出的方法,该方法能够生成具有长期一致性的音频。为了克服 MIDI/音频配对数据集的缺乏,我们不仅使用了现有的吉他数据集,还从高质量的基于采样的吉他合成器中收集了数据。通过定量和定性评估,我们表明所提出的模型比基线模型具有更高的音频质量,并且比此前的领先工作生成更逼真的音色。

关键词

引用

@article{arxiv.2401.13498,
  title  = {Expressive Acoustic Guitar Sound Synthesis with an Instrument-Specific Input Representation and Diffusion Outpainting},
  author = {Hounsu Kim and Soonbeom Choi and Juhan Nam},
  journal= {arXiv preprint arXiv:2401.13498},
  year   = {2024}
}

备注

Accepted to ICASSP 2024