利用高斯混合模型概率估计器增强喉麦克风录音
音频与语音处理
2018-04-18 v1 信号处理
摘要
喉麦克风是一种贴附于身体的换能器,佩戴于颈部。它捕获经声带传输的信号以及喉部的蜂鸣音调。由于其皮肤接触特性,相较于通过空气压力拾取振动并因而受所有干扰的声学麦克风,它对环境噪声更具鲁棒性。喉语音部分可懂,但发出不自然且嘶哑的声音。本论文试图恢复喉语音的缺失频带,并结合喉麦克风与声学麦克风录音的联合分析研究包络与激励映射问题。提出了一种新颖的、与音素相关的基于 GMM 的频谱包络映射方案,其对声学麦克风频谱包络执行最小均方误差(MMSE)估计。在源-滤波器分解框架下,我们观察到喉麦克风与声学麦克风录音的激励信号之频谱包络差异是喉麦克风语音质量退化的一个重要来源。因此,我们还将激励信号的频谱包络差异建模为频谱倾斜向量,并提出一种新颖的、与音素相关的基于 GMM 的频谱倾斜映射方案以增强喉激励信号。实验评估通过客观与主观评价对所提映射方案进行比较。客观评价采用对数谱失真(LSD)与宽带语音质量感知评估(PESQ)指标。主观评价采用 A/B 成对比较试听测试。客观与主观评价均表明,所提与音素相关的映射相较最先进的 GMM 估计器一致地改善性能。
引用
@article{arxiv.1804.05937,
title = {Enhancement of Throat Microphone Recordings Using Gaussian Mixture Model Probabilistic Estimator},
author = {Mehmet Ali Tugtekin Turan},
journal= {arXiv preprint arXiv:1804.05937},
year = {2018}
}
备注
M.Sc. Thesis