DeepGESI:面向听力受损听者的非侵入式语音可懂性评估模型
声音
2025-12-23 v1
摘要
语音可懂性评估是许多语音相关应用的必需任务。然而,大多数客观可懂性指标都是侵入式的,需除干净参考语音外还需额外提供受劣化或加工信号进行评估。此外,现有指标如 STOI 主要针对正常听力者设计,其对听力受损语音可懂性的预测准确性仍有限。另一方面,GESI(Gammachirp Envelope Similarity Index)可用于估计听力受损听者的可懂性,但其同样为侵入式,因其依赖参考信号而限制了实际场景的应用。为克服此限制,本研究提出 DeepGESI,一种基于深度学习的非侵入式模型,能够在不要求任何干净参考语音的情况下准确且高效地预测听力受损听者的语音可懂性。实验结果表明,在 2022 年 Clarity Prediction Challenge(CPC2)数据集的测试条件下,DeepGESI 预测的 GESI 分数与实际 GESI 分数之间存在强相关性。此外,所提出的模型相较于传统方法实现了显著的预测速度提升。
引用
@article{arxiv.2512.19374,
title = {DeepGESI: A Non-Intrusive Objective Evaluation Model for Predicting Speech Intelligibility in Hearing-Impaired Listeners},
author = {Wenyu Luo and Jinhui Chen},
journal= {arXiv preprint arXiv:2512.19374},
year = {2025}
}