RawNet:快速端到端神经声码器
音频与语音处理
2023-03-13 v2 机器学习
声音
机器学习
摘要
基于神经网络的声码器近来已展现出合成高质量语音的强大能力。这些模型通常通过以频谱特征(如梅尔频谱图和基频)为条件来生成采样,而这对语音合成至关重要。然而,特征提取过程往往严重依赖人类知识,导致对原始音频的描述表达能力不足。在本工作中,我们提出了 RawNet,一种遵循自编码器结构、用于说话人相关与说话人无关语音合成的完整端到端神经声码器。它利用神经网络自动学习提取特征并恢复音频,其中包括一个用于捕获输入音频更高阶表示的编码器(coder)网络,以及一个以逐采样方式还原音频的自回归解码器(voder)网络。编码器与解码器直接在原始波形上联合训练,无需任何人工设计的特征。实验结果表明,RawNet 以简化的模型架构实现了更好的语音质量,并在推理阶段获得了更快的语音生成速度。
引用
@article{arxiv.1904.05351,
title = {RawNet: Fast End-to-End Neural Vocoder},
author = {Yunchao He and Yujun Wang},
journal= {arXiv preprint arXiv:1904.05351},
year = {2023}
}