基于区间空旷分解的可扩展神经语音合成器
声音
2026-03-11 v2
摘要
尽管深度神经网络在近年来显著推动了神经语音合成器的发展,但它们通常面临内在挑战,如建模不透明、在不同输入配置下重新训练不灵活以及参数与性能之间的权衡。这些固有障碍严重阻碍了该领域的发展。为解决这些问题,本文提出了一种基于时间频率(T-F)域的新型神经语音合成器。具体而言,我们将经典的区间空旷分解(RND)理论与语音合成任务相结合,其中目标语谱图的重建被形式化为区间空间与空旷空间的叠加。前者旨在将原始mel域的表示投射到目标线性尺度域,而后者可通过神经网络实现以进一步填充频谱细节。为了充分利用频谱先验,设计了精细的双路径框架,其中频谱被层次化编码和解码,交叉和窄带模块用于有效地沿次带和时间维度建模。为实现各种配置下的推理,我们提出了一种简单而有效的策略,将推理阶段的多条件适配转化为训练阶段的数据增强。我们在 various基准上进行了全面实验。定量和定性结果表明,虽然网络结构轻巧且推理范式可扩展,所提出的框架在现有先进方法中实现了state-of-the-art性能。代码已公开于https://github.com/Andong-Li-speech/RNDVoC。
引用
@article{arxiv.2603.08574,
title = {Scalable Neural Vocoder from Range-Null Space Decomposition},
author = {Andong Li and Tong Lei and Zhihang Sun and Rilin Chen and Xiaodong Li and Dong Yu and Chengshi Zheng},
journal= {arXiv preprint arXiv:2603.08574},
year = {2026}
}
备注
30 pages, 30 figures, 21 tables, Extension journal