中文

用于语音可懂性预测的 多层 听力损失建模

音频与语音处理 2025-07-31 v1

摘要

各种听力损失的感知后果严重阻碍了语音交流,但标准临床听力测量专注于基于阈值的频率灵敏度,无法充分捕捉频率和时序分辨率的损失。为此,我们提出一种语音可懂性预测方法,通过扩宽 听觉滤波器和应用低通调制滤波来模拟听力损失的严重程度。随后对语音信号进行分析,使用 谱时序调制 (STM) 表征,这反映了听觉分辨率损失如何改变底层调制结构。此外,归一化交叉相关 (NCC) 矩阵量化干净语音和噪声语音之间的相似性。这些 听觉信息特征被用于训练基于 Vision Transformer 的回归模型,将 STM 图和 NCC 嵌入整合以估计语音可懂性分数。在 Clarity Prediction Challenge 语料库上的评估显示,我们的方法在轻度和中重度听力损失组中均优于 Hearing-Aid Speech Perception Index v2 (HASPI v2),分别将均方根误差降低 16.5% 和 6.1%。这些结果突显了对特定听者的频率和时序分辨率损失进行显式建模对提高语音可懂性预测和提供听觉失真解释的重要性。

关键词

引用

@article{arxiv.2507.22599,
  title  = {Modeling Multi-Level Hearing Loss for Speech Intelligibility Prediction},
  author = {Xiajie Zhou and Candy Olivia Mawalim and Masashi Unoki},
  journal= {arXiv preprint arXiv:2507.22599},
  year   = {2025}
}

备注

5 pages, 2 figures, to appear in WASPAA 2025