中文

基于不确定性感知 Whisper 嵌入与 sLSTM 的语音可懂性评估

音频与语音处理 2025-09-05 v2 声音

摘要

非侵入式语音可懂性预测因说话者、噪声条件及主观感知的可变性而具有挑战性。我们提出一种基于不确定性感知的方法,利用 Whisper 嵌入结合统计特征,具体包括跨嵌入维度计算得到的均值、标准差和熵。熵通过对特征维度进行 softmax 计算,用作不确定性的代理,从而补充由均值和标准差捕获的全局信息。为建模语音的序列结构,我们采用标量长短期记忆网络(sLSTM),该网络高效地捕获长程依赖关系。基于此构架,我们提出 iMTI-Net,即改进的多目标可懂性预测网络,该网络在多任务学习框架内集成卷积神经网络(CNN)和 sLSTM 组件,联合预测人类可懂性评分和基于 Google ASR 与 Whisper 的机器词错误率(WER)。实验结果表明,iMTI-Net 在多个评估指标上均优于原始 MTI-Net,显示了 incorporating 不确定性感知特征和 CNN-sLSTM 构架的有效性。

关键词

引用

@article{arxiv.2509.03013,
  title  = {Speech Intelligibility Assessment with Uncertainty-Aware Whisper Embeddings and sLSTM},
  author = {Ryandhimas E. Zezario and Dyah A. M. G. Wisnu and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2509.03013},
  year   = {2025}
}

备注

Accepted to APSIPA ASC 2025