中文

基于范围-零空间分解学习神经语音合成器

声音 2025-07-29 v1

摘要

尽管近年来神经语音合成器取得了快速发展,但它们通常面临着模型不透明、参数与性能之间的权衡等内在挑战。本研究提出一种创新的时频(T-F)域基于神经语音合成器,以解决上述挑战。具体而言,我们将经典信号范围-零空间(RND)理论与语音合成任务建立联系,目标声谱图的重建可分解为范围空间与零空间的叠加,其中前者通过从原始 mel 尺度域到目标线性尺度域的线性域位移实现,后者通过可学习网络实现以进行进一步的谱细节生成。因此,我们提出了一种新型双路径框架,其中 spectrum 被分层编码/解码,交叉和窄带模块精心设计以实现高效的子带和顺序建模。在 LJSpeech 和 LibriTTS 基准测试上进行了全面实验。定量和定性结果表明,虽然网络参数较轻,所提出的方法在现有先进方法中实现了业界最佳性能。我们的代码和预训练模型权重可在 https://github.com/Andong-Li-speech/RNDVoC 上获得。

关键词

引用

@article{arxiv.2507.20731,
  title  = {Learning Neural Vocoder from Range-Null Space Decomposition},
  author = {Andong Li and Tong Lei and Zhihang Sun and Rilin Chen and Erwei Yin and Xiaodong Li and Chengshi Zheng},
  journal= {arXiv preprint arXiv:2507.20731},
  year   = {2025}
}

备注

10 pages, 7 figures, IJCAI2025