面向个性化多模态助听器的基于环境偏好的语音增强
声音
2024-02-27 v1 音频与语音处理
摘要
自深度学习 (DL) 出现以来,语音增强 (SE) 模型在各种噪声条件下表现良好。然而,此类系统仍可能引入声音伪影,听起来不自然,并限制用户听到可能至关重要的环境声音的能力。助听器 (HA) 用户可能希望定制其 SE 系统以适应个人偏好和日常生活。在本文中,我们介绍了一种基于偏好学习的 SE (PLSE) 模型,用于未来的多模态助听器,该模型可根据用户偏好利用上下文音频信息来提高聆听舒适度。所提系统估计信噪比 (SNR) 作为基本的客观语音质量度量,该度量量化了语音中存在的背景噪声相对量,并与信号的可懂度直接相关。此外,为了提供上下文信息,我们预测用户所处的声学场景。这些任务通过多任务 DL 模型实现,该模型通过联合利用共享编码特征空间,超越了单独推断声学场景或 SNR 的性能。这些环境推断被用于偏好 elicitation 框架中,该框架线性学习一组预测函数以确定视听 (AV) SE 系统的目标 SNR。通过大幅减少挑战性聆听条件下的噪声,并新颖地缩放 SE 模型的输出,我们能够为用户提供上下文个性化的 SE。初步结果表明,在某些参与者中,该模型优于非个性化基线模型。
引用
@article{arxiv.2402.16757,
title = {Towards Environmental Preference Based Speech Enhancement For Individualised Multi-Modal Hearing Aids},
author = {Jasper Kirton-Wingate and Shafique Ahmed and Adeel Hussain and Mandar Gogate and Kia Dashtipour and Jen-Cheng Hou and Tassadaq Hussain and Yu Tsao and Amir Hussain},
journal= {arXiv preprint arXiv:2402.16757},
year = {2024}
}
备注
This has been submitted to the Trends in Hearing journal