无别名神经音频合成
声音
2026-05-14 v2 音频与语音处理
信号处理
摘要
在神经音频合成中,神经声学器和编解码器是从声学和潜表示重建波形的模型,这对于最终音频质量至关重要。虽然当前模型能够生成感知上自然的语音,但在高保真度音乐和歌声合成方面仍存在挑战,因为现有架构中的非线性激活函数和上采样层会引入严重的别名失真。虽然已提出多种数字信号处理中的防别名技术,但其整合到神经声学器和编解码器中仍受到较少关注。本文将可微防别名技术整合到激活和上采样模块中,以填补这一差距,从而提出Pupu-Vocoder和Pupu-Codec。我们构建了一个测试信号基准来评估防别名模块,并在语音、歌声、音乐和音频上验证了所提出的模型。实验结果表明,Pupu-Vocoder和Pupu-Codec 在歌声、音乐和音频方面均优于现有系统,而在语音方面实现了可比的性能。演示、代码和检查点均可在VocodexElysium.github.io/AliasingFreeNeuralAudioSynthesis/上获取。
关键词
引用
@article{arxiv.2512.20211,
title = {Aliasing-Free Neural Audio Synthesis},
author = {Yicheng Gu and Junan Zhang and Chaoren Wang and Jerry Li and Zhizheng Wu and Lauri Juvela},
journal= {arXiv preprint arXiv:2512.20211},
year = {2026}
}
备注
Accepted by TASLP