中文

使用Transformer架构的原始音频生成模型

声音 2021-07-09 v3 人工智能 机器学习 多媒体 音频与语音处理

摘要

本文提出一种使用Transformer架构在波形层面进行音频合成的新方法。我们提出一个用于生成波形的深度神经网络,类似于 wavenet。这是完全概率的、自回归的且因果的,即每个生成的样本仅依赖于先前观测到的样本。我们的方法在类似数据集上预测下一步时,比广泛使用的 wavenet 架构高出至多9%。利用注意力机制,我们使架构能够学习哪些音频样本对预测未来样本是重要的。我们展示了因果Transformer生成模型如何用于原始波形合成。我们还表明,通过在更宽上下文上条件化样本,该性能可再提升2%。当前模型从潜表示合成音频的灵活性暗示了大量潜在应用。然而,这种使用生成式Transformer架构进行原始音频合成的新方法,在不使用潜码/元数据辅助生成过程的情况下,仍远未生成任何有意义的音乐。

关键词

引用

@article{arxiv.2106.16036,
  title  = {A Generative Model for Raw Audio Using Transformer Architectures},
  author = {Prateek Verma and Chris Chafe},
  journal= {arXiv preprint arXiv:2106.16036},
  year   = {2021}
}

备注

DAFX 2021