DeepA:一种用于语音与歌唱声码化的深度神经分析器
音频与语音处理
2021-10-14 v1 机器学习
声音
摘要
传统声码器通常用作分析工具,为语音合成和声音转换等下游任务提供可解释的特徵。它们基于信号遵循信号处理原理的某些假设构建,因此不易推广到不同音频,例如从语音到歌唱。本文中,我们提出一种深度神经分析器,记为DeepA——一种从输入语音中提取F0与音色/非周期编码以模拟传统声码器中定义的神经声码器。因此,所得参数比其他潜在神经表示更具可解释性。同时,由于深度神经分析器是可学习的,有望在信号重建与处理上更准确,并能从语音推广到歌唱。所提出的神经分析器基于变分自编码器(VAE)架构构建。我们表明DeepA在F0估计上优于传统声码器(WORLD)。据我们所知,这是首个致力于开发用于提取可学习类声码器参数的神经框架的研究。
引用
@article{arxiv.2110.06434,
title = {DeepA: A Deep Neural Analyzer For Speech And Singing Vocoding},
author = {Sergey Nikonorov and Berrak Sisman and Mingyang Zhang and Haizhou Li},
journal= {arXiv preprint arXiv:2110.06434},
year = {2021}
}
备注
Accepted to ASRU 2021