基于不确定性感知 Whisper 嵌入与 sLSTM 的语音可懂性评估
音频与语音处理
2025-09-05 v2 声音
摘要
非侵入式语音可懂性预测因说话者、噪声条件及主观感知的可变性而具有挑战性。我们提出一种基于不确定性感知的方法,利用 Whisper 嵌入结合统计特征,具体包括跨嵌入维度计算得到的均值、标准差和熵。熵通过对特征维度进行 softmax 计算,用作不确定性的代理,从而补充由均值和标准差捕获的全局信息。为建模语音的序列结构,我们采用标量长短期记忆网络(sLSTM),该网络高效地捕获长程依赖关系。基于此构架,我们提出 iMTI-Net,即改进的多目标可懂性预测网络,该网络在多任务学习框架内集成卷积神经网络(CNN)和 sLSTM 组件,联合预测人类可懂性评分和基于 Google ASR 与 Whisper 的机器词错误率(WER)。实验结果表明,iMTI-Net 在多个评估指标上均优于原始 MTI-Net,显示了 incorporating 不确定性感知特征和 CNN-sLSTM 构架的有效性。
引用
@article{arxiv.2509.03013,
title = {Speech Intelligibility Assessment with Uncertainty-Aware Whisper Embeddings and sLSTM},
author = {Ryandhimas E. Zezario and Dyah A. M. G. Wisnu and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2509.03013},
year = {2025}
}
备注
Accepted to APSIPA ASC 2025