MSR-NV:采用多采样率的神经声码器
音频与语音处理
2022-06-27 v3 机器学习
声音
摘要
神经声码器(NV)的发展实现了高质量且快速的波形生成。然而,传统 NV 针对单一采样率,在应用于不同采样率时需要重新训练。由于语音质量与生成速度之间的权衡,合适的采样率因应用而异。本研究提出一种在单一 NV 中处理多采样率的方法,称为 MSR-NV。通过从低采样率开始逐步生成波形,MSR-NV 能高效学习各频带特征并以多采样率合成高质量语音。它可视为对先前所提 NV 的扩展,本研究中我们扩展了 Parallel WaveGAN(PWG)的结构。实验评估结果表明,所提方法在 16、24 和 48 kHz 下均比分别训练的原始 PWG 取得显著更高的主观质量,且不增加推理时间。我们还展示了 MSR-NV 可利用更低采样率语音进一步提升合成语音质量。
引用
@article{arxiv.2109.13714,
title = {MSR-NV: Neural Vocoder Using Multiple Sampling Rates},
author = {Kentaro Mitsui and Kei Sawada},
journal= {arXiv preprint arXiv:2109.13714},
year = {2022}
}
备注
6 pages including supplement, 3 figures, accepted for INTERSPEECH 2022. Audio samples: https://rinnakk.github.io/research/publications/MSR-NV/