中文

面向低延迟交互的神经合成器设计

声音 2025-04-15 v2 人工智能 机器学习 音频与语音处理

摘要

神经音频合成(NAS)模型为高质量、富有表现力的音频生成器提供了交互式音乐控制。尽管这些模型能够实时运行,但它们通常存在高延迟问题,使其不适合紧密的音乐交互。在 NAS 文献中,深度学习模型的架构选择对音频延迟的影响在很大程度上尚未被探索。在本工作中,我们研究了交互式 NAS 模型中常见的延迟和抖动来源。然后,我们将此分析应用于使用 RAVE 进行音色迁移的任务,RAVE 是 Caillon 等人于 2021 年提出的一种用于音频波形的卷积变分自编码器。最后,我们提出了一种用于优化延迟的迭代设计方法。这最终形成了一个我们称之为 BRAVE(Bravely Realtime Audio Variational autoEncoder)的模型,该模型具有低延迟特性,在音高和响度复制方面表现更佳,同时展现出与 RAVE 相似的音色修改能力。我们在一个专用的低延迟实时推理框架中实现了它,并展示了一个兼容来自乐器音频信号的概念验证音频插件。我们期望本文中描述的挑战和指南能够支持 NAS 研究人员从头开始设计低延迟推理模型,丰富音乐家的可能性空间。

关键词

引用

@article{arxiv.2503.11562,
  title  = {Designing Neural Synthesizers for Low-Latency Interaction},
  author = {Franco Caspe and Jordie Shier and Mark Sandler and Charalampos Saitis and Andrew McPherson},
  journal= {arXiv preprint arXiv:2503.11562},
  year   = {2025}
}

备注

See website at fcaspe.github.io/brave - 13 pages, 5 figures, accepted to the Journal of the Audio Engineering Society, LaTeX; Corrected typos, added hyphen to title to reflect JAES version