多目标非侵入式助听器语音评估模型
音频与语音处理
2023-11-16 v1 声音
摘要
无需干净参考的非侵入式语音评估方法因客观评价而备受关注。尽管深度学习模型已用于开发展现出前景的非侵入式语音评估方法,但针对听力受损受试者的研究有限。本研究提出一种多目标非侵入式助听器语音评估模型,称为 HASA-Net Large,其基于输入语音信号与指定听力损失模式预测语音质量与可懂度分数。我们的实验表明,相较于以谱图作为输入,利用预训练 SSL 模型显著提升了语音质量与可懂度预测。此外,我们考察了三种不同的微调方法,进一步带来了性能提升。进而,我们证明引入 SSL 模型可增强对 OOD 数据集的迁移性。最后,本研究引入 HASA-Net Large,一种评估语音质量与可懂度的非侵入式方法。HASA-Net Large 利用原始波形与听力损失模式准确预测正常与受损听力个体的语音质量与可懂度水平,并展现出优越的预测性能与迁移性。
引用
@article{arxiv.2311.08878,
title = {Multi-objective Non-intrusive Hearing-aid Speech Assessment Model},
author = {Hsin-Tien Chiang and Szu-Wei Fu and Hsin-Min Wang and Yu Tsao and John H. L. Hansen},
journal= {arXiv preprint arXiv:2311.08878},
year = {2023}
}