使用Transformer架构的原始音频生成模型
声音
2021-07-09 v3 人工智能
机器学习
多媒体
音频与语音处理
摘要
本文提出一种使用Transformer架构在波形层面进行音频合成的新方法。我们提出一个用于生成波形的深度神经网络,类似于 wavenet。这是完全概率的、自回归的且因果的,即每个生成的样本仅依赖于先前观测到的样本。我们的方法在类似数据集上预测下一步时,比广泛使用的 wavenet 架构高出至多9%。利用注意力机制,我们使架构能够学习哪些音频样本对预测未来样本是重要的。我们展示了因果Transformer生成模型如何用于原始波形合成。我们还表明,通过在更宽上下文上条件化样本,该性能可再提升2%。当前模型从潜表示合成音频的灵活性暗示了大量潜在应用。然而,这种使用生成式Transformer架构进行原始音频合成的新方法,在不使用潜码/元数据辅助生成过程的情况下,仍远未生成任何有意义的音乐。
引用
@article{arxiv.2106.16036,
title = {A Generative Model for Raw Audio Using Transformer Architectures},
author = {Prateek Verma and Chris Chafe},
journal= {arXiv preprint arXiv:2106.16036},
year = {2021}
}
备注
DAFX 2021