中文

残差信号的确定性加随机模型及其应用

声音 2020-01-07 v1 计算与语言 音频与语音处理

摘要

语音产生建模通常依赖于源-滤波器方法。尽管参数化滤波器的的方法如今已达到一定成熟度,但在寻找合适的激励模型方面,若干语音处理应用仍有很大收益空间。本稿提出残差信号的确定性加随机模型(DSM)。DSM由两部分组成,作用于以最大浊音频率界定的两个不同频带。两个分量均提取自对说话人相关、基音同步残差帧数据集的分析。确定性部分建模低频内容,源于这些帧的正交分解。至于随机分量,则是时频均受调制的高频噪声。文中还强调了DSM若干有趣的语音学性质和计算性质。随后研究了DSM在语音处理两个领域的适用性。首先,将DSM声码器纳入基于HMM的语音合成可提升输出质量;所提方法显著优于传统脉冲激励,并提供与STRAIGHT相当的质量。在第二项应用中,探究了源自所提DSM的声门特征用于说话人识别的潜力。有趣的是,这些特征被证明比其他基于声门的方法带来更好的识别率。

关键词

引用

@article{arxiv.2001.01000,
  title  = {The Deterministic plus Stochastic Model of the Residual Signal and its Applications},
  author = {Thomas Drugman and Thierry Dutoit},
  journal= {arXiv preprint arXiv:2001.01000},
  year   = {2020}
}