基于 ARMAX-LF 模型的声道与喉源参数建模与估计
声音
2024-10-08 v1 计算与语言
音频与语音处理
摘要
从原始语音中对元音的声道和喉源参数进行建模与估计,通常采用 Auto-Regressive with eXogenous input(ARX)模型和 Liljencrants-Fant(LF)模型,并采用迭代式估计方法。然而,声道滤波器中的全极点自回模型无法提供反型(anti-formants)的位置,这在处理鼻化元音、摩擦音和塞音等某些语音类别时会导致估计误差增大。本文提出 Auto-Regressive Moving Average eXogenous with LF(ARMAX-LF)模型,将 ARX-LF 模型扩展到更广泛的语音类别,包括元音和鼻化辅音。LF 模型将喉源导数表示为参数化时域模型,ARMAX 模型将声道表示为极点-零点滤波器,并以额外的 LF 激发作为输入。为减少估计误差,我们首先利用深度神经网络(DNN)的强大非线性拟合能力,构建从提取的喉源导数或语音波形到相应 LF 参数的映射。随后,喉源和声道参数可在不进行分析-合成策略中迭代的情况下以更少的估计误差进行估计。实验结果包括使用线性源-滤波模型、物理模型以及真实语音信号的合成语音,表明采用 DNN 基于估计方法的提出的 ARMAX-LF 模型能够以更少的误差和估计时间估计元音和鼻化声音的参数。
关键词
引用
@article{arxiv.2410.04704,
title = {Modeling and Estimation of Vocal Tract and Glottal Source Parameters Using ARMAX-LF Model},
author = {Kai Lia and Masato Akagia and Yongwei Lib and Masashi Unokia},
journal= {arXiv preprint arXiv:2410.04704},
year = {2024}
}