基于音素的_ratio mask_估计用于人工耳蜗处理器中的混响语音增强
音频与语音处理
2021-06-01 v1 声音
摘要
人工耳蜗(CI)使用者在混响聆听环境中理解语音存在相当大的困难。时频(T-F)掩蔽是一种常用技术,旨在通过用增益值矩阵乘以混响语音来抑制由混响主导的T-F频块,从而提高语音可懂度。最近提出的掩蔽估计算法利用机器学习方法来区分目标语音与混响反射。然而,语音的谱时结构高度可变且依赖于底层音素。潜在克服这种可变性的一种方法是在掩蔽估计过程中利用音素信息的显式知识。本研究提出一种基于音素的掩蔽估计算法,其中为每个音素分别训练掩蔽估计模型。在正常听力听者中进行了句子识别测试,以确定在可获得音素完美知识的理想场景下,基于音素的掩蔽估计算法是否有益。结果表明,与传统的音素无关掩蔽相比,基于音素的掩蔽提高了声码语音的可懂度。结果表明,基于音素的语音增强策略可能使CI使用者受益于混响聆听环境。
引用
@article{arxiv.2105.14135,
title = {Phoneme-Based Ratio Mask Estimation for Reverberant Speech Enhancement in Cochlear Implant Processors},
author = {Kevin M. Chu and Leslie M. Collins and Boyla O. Mainsah},
journal= {arXiv preprint arXiv:2105.14135},
year = {2021}
}