中文

用于乐器音色交互式生成的谱图修复

声音 2021-04-16 v1 人工智能 人机交互 音频与语音处理

摘要

使用深度神经网络的现代声音合成方法难以控制,尤其在缺乏细粒度条件信息时,这阻碍了音乐家对它们的采用。本文将单个乐器音符的生成视为基于修复(inpainting)的任务,引入了新颖且独特的方式来迭代塑造声音。为此,我们提出一种两步方法:首先,我们将VQ-VAE-2图像生成架构适配到谱图,以将实值谱图转换为紧凑的离散编码图;随后我们实现令牌掩码Transformer用于这些编码图的基于修复的生成。我们将所提架构应用于NSynth数据集上的掩码重采样任务。最关键的是,我们开源了一个交互式网页界面,供艺术家与从业者通过修复来变换声音,从而开启了新的创造性用途。

关键词

引用

@article{arxiv.2104.07519,
  title  = {Spectrogram Inpainting for Interactive Generation of Instrument Sounds},
  author = {Théis Bazin and Gaëtan Hadjeres and Philippe Esling and Mikhail Malt},
  journal= {arXiv preprint arXiv:2104.07519},
  year   = {2021}
}

备注

8 pages + references + appendices. 4 figures. Published as a conference paper at the The 2020 Joint Conference on AI Music Creativity, October 19-23, 2020, organized and hosted virtually by the Royal Institute of Technology (KTH), Stockholm, Sweden