具有非因果卷积的可流式神经音频合成
声音
2022-04-15 v1 机器学习
音频与语音处理
机器学习
摘要
深度学习模型大多以离线推理方式使用。然而,这严重限制了这些模型在音频生成设置中的使用,因为大多数创作工作流基于实时数字信号处理。尽管基于循环网络的方法可自然适应这种基于缓冲的计算,但卷积的使用仍带来一些严峻挑战。为解决此问题,已提出使用因果流式卷积。然而,这需要特定的复杂化训练并可能影响最终音频质量。本文引入一种新方法,允许生成非因果流式模型。这使得任何卷积模型都能兼容实时基于缓冲的处理。由于我们的方法基于训练后模型重配置,我们表明它能够将无因果约束训练的模型转换为流式模型。我们展示了我们的方法如何适应具有并行分支的复杂架构。为评估方法,我们将其应用于近期提供高质量实时音频合成的 RAVE 模型。我们在多个音乐和语音数据集上测试该方法,表明其比重叠相加方法更快,且对生成质量无影响。最后,我们以 Max/MSP 和 PureData 外部对象以及 VST 音频插件形式引入两种开源实现。这使得传统数字音频工作站能够在笔记本 CPU 上进行实时神经音频合成。
引用
@article{arxiv.2204.07064,
title = {Streamable Neural Audio Synthesis With Non-Causal Convolutions},
author = {Antoine Caillon and Philippe Esling},
journal= {arXiv preprint arXiv:2204.07064},
year = {2022}
}