利用基于全卷积网络的语音增强改善电声刺激语音可懂度
声音
2019-09-27 v1 音频与语音处理
摘要
联合电声刺激(EAS)已展现出优于传统人工耳蜗(CI)的语音识别能力,并在安静条件下取得满意表现。然而,当存在噪声信号时,电信号与声信号均可能失真,从而导致识别性能下降。为抑制噪声影响,语音增强(SE)是 EAS 设备中的必要单元。近来,一种基于全卷积神经网络(FCN)且采用短时客观可懂度(STOI)基目标函数(简称 FCN(S))的时域语音增强算法因其结构简单及从含噪语音中恢复干净语音信号的有效性而受到日益关注。鉴于 FCN(S) 对正常语音的益处,本研究着手评估其改善 EAS 模拟语音可懂度的能力。我们进行了客观评估与听音测试,以检验 FCN(S) 在噪声环境下改善正常与声码语音可懂度的性能。实验结果显示,相较于传统最小均方误差 SE 方法与深度去噪自编码器 SE 方法,FCN(S) 对正常及声码语音均可获得更好的语音可懂度增益。本研究首次评估了面向 EAS 的深度学习 SE 方法,确认 FCN(S) 是一种有效的 SE 方法,有望集成至 EAS 处理器以惠及噪声环境中的用户。
引用
@article{arxiv.1909.11912,
title = {Improving the Intelligibility of Electric and Acoustic Stimulation Speech Using Fully Convolutional Networks Based Speech Enhancement},
author = {Natalie Yu-Hsien Wang and Hsiao-Lan Sharon Wang and Tao-Wei Wang and Szu-Wei Fu and Xugan Lu and Yu Tsao and Hsin-Min Wang},
journal= {arXiv preprint arXiv:1909.11912},
year = {2019}
}