中文

SING:符号到乐器的神经网络生成器

声音 2018-10-24 v1 机器学习 音频与语音处理 机器学习

摘要

音频合成深度学习的近期进展开辟了直接生成波形的模型之路,摆脱了依赖声码器或 MIDI 合成器进行语音或音乐生成的传统范式。尽管取得了成功,当前最先进的神经音频合成器如 WaveNet 和 SampleRNN 由于基于自回归模型以 16kHz 的速率逐样本生成音频,面临训练与推理时间过高的难题。在本工作中,我们研究以大幅步长逐帧生成波形这一计算效率更高的替代方案。我们提出 SING,一种轻量级神经音频合成器,用于给定目标乐器、音高和力度生成音符这一原始任务。得益于一种最小化生成波形与目标波形对数谱图之间距离的新损失函数,我们的模型以单一解码器端到端训练,可生成近 1000 种乐器的音符。在合成训练时未见的音高与乐器组合音符的泛化任务上,根据平均意见得分(MOS)衡量,SING 生成的音频感知质量较基于 WaveNet 的最先进自编码器显著提升,且训练速度约快 32 倍、推理速度约快 2500 倍。

关键词

引用

@article{arxiv.1810.09785,
  title  = {SING: Symbol-to-Instrument Neural Generator},
  author = {Alexandre Défossez and Neil Zeghidour and Nicolas Usunier and Léon Bottou and Francis Bach},
  journal= {arXiv preprint arXiv:1810.09785},
  year   = {2018}
}