中文

Catch-A-Waveform:从单个短例程学习生成音频

声音 2021-10-27 v2 机器学习 音频与语音处理

摘要

音频生成模型通常在数小时的录音上训练。在此,我们说明捕获音频源的本质通常仅需来自单个训练信号的数十秒片段。具体而言,我们提出一种基于GAN的生成模型,可在来自任意领域(如语音、音乐等)的一个短音频信号上训练,且不需要预训练或任何其他形式的外部监督。一旦训练完成,我们的模型可生成任意时长的随机样本,这些样本与训练波形保持语义相似,但展现其音频基元的新组合。这使得一系列有趣应用成为可能,包括基于单个短例生成新的爵士即兴或新无伴奏说唱变体、对著名歌曲进行连贯修改(例如仅基于原始录音为披头士歌曲添加新段落)、缺失部分填充(修复)、扩展语音信号带宽(超分辨率),以及在无法获取任何干净训练样本的情况下增强老录音。我们展示在所有情况下,不超过20秒的训练音频通常足以使我们的模型取得最先进(SOTA)结果。尽管该模型完全缺乏对音频信号一般特性的先验知识。

关键词

引用

@article{arxiv.2106.06426,
  title  = {Catch-A-Waveform: Learning to Generate Audio from a Single Short Example},
  author = {Gal Greshler and Tamar Rott Shaham and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2106.06426},
  year   = {2021}
}