原始音频!基于状态空间模型的音频生成
声音
2022-02-22 v1 人工智能
机器学习
音频与语音处理
摘要
由于音频波形的高采样率,开发适用于建模原始音频的架构是一个具有挑战性的问题。RNN 和 CNN 等标准序列建模方法先前已被调整以满足音频的需求,但由此产生的架构做出了不理想的计算权衡,并且难以有效地建模波形。我们提出了 SaShiMi,一种围绕最近引入的用于长序列建模的 S4 模型构建的用于波形建模的新多尺度架构。我们指出 S4 在自回归生成过程中可能不稳定,并通过联系 Hurwitz 矩阵对其参数化给出了一个简单的改进。SaShiMi 在自回归设置下的无条件波形生成中取得了最先进的性能。此外,当用作扩散模型的骨干架构时,SaShiMi 提升了非自回归生成性能。与自回归生成设置下的先前架构相比,SaShiMi 生成的钢琴和语音波形分别被人类认为更具音乐性和连贯性,例如在无条件语音生成任务上比 WaveNet 的平均意见得分高 2 倍。在音乐生成任务上,SaShiMi 在密度估计以及训练和推理速度上均优于 WaveNet,即使使用的参数少 3 倍。代码可在 https://github.com/HazyResearch/state-spaces 找到,样本在 https://hazyresearch.stanford.edu/sashimi-examples。
引用
@article{arxiv.2202.09729,
title = {It's Raw! Audio Generation with State-Space Models},
author = {Karan Goel and Albert Gu and Chris Donahue and Christopher Ré},
journal= {arXiv preprint arXiv:2202.09729},
year = {2022}
}
备注
23 pages, 7 figures, 7 tables