利用中间 ASR 特征与人类记忆模型对听障用户进行非侵入式语音可懂度预测
声音
2024-01-25 v1 人工智能
音频与语音处理
摘要
神经网络已成功用于非侵入式语音可懂度预测。最近,研究发现,使用源自预训练自监督和弱监督模型中间层的特征表示对于此任务特别有用。这项工作将使用 Whisper ASR 解码器层表示作为神经网络输入特征,与一个基于范例的、受心理学启发的人类记忆模型相结合,来预测助听器用户的人类可懂度评分。与已建立的侵入式 HASPI 基线系统相比,性能有显著提升,包括在训练数据中未见过的增强系统和听者上,均方根误差为 25.3,而基线为 28.7。
引用
@article{arxiv.2401.13611,
title = {Non-Intrusive Speech Intelligibility Prediction for Hearing-Impaired Users using Intermediate ASR Features and Human Memory Models},
author = {Rhiannon Mogridge and George Close and Robert Sutherland and Thomas Hain and Jon Barker and Stefan Goetze and Anton Ragni},
journal= {arXiv preprint arXiv:2401.13611},
year = {2024}
}
备注
Accepted paper. IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP), Seoul, Korea, April 2024