中文

无需听力图:利用已有得分进行个性化语音可懂度预测

音频与语音处理 2025-06-04 v1 人工智能 声音

摘要

个性化语音可懂度预测具有挑战性。以往的方法主要依赖于听力图,但由于其仅捕获听者对纯音的听力阈值,因此在准确性上存在固有局限。我们并未引入额外的听者特征,而是提出了一种新颖的方法,利用个体已有的可懂度数据来预测其在新音频上的表现。我们提出了基于支持样本的可懂度预测网络(SSIPNet),这是一种深度学习模型,利用语音基础模型从多个支持(音频,得分)对中构建听者语音识别能力的高维表示,从而实现对未见音频的准确预测。在 Clarity Prediction Challenge 数据集上的结果表明,即使使用少量支持(音频,得分)对,我们的方法也优于基于听力图的预测。我们的工作为个性化语音可懂度预测提出了一种新范式。

关键词

引用

@article{arxiv.2506.02039,
  title  = {No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction},
  author = {Haoshuai Zhou and Changgeng Mo and Boxuan Cao and Linkai Li and Shan Xiang Wang},
  journal= {arXiv preprint arXiv:2506.02039},
  year   = {2025}
}

备注

Accepted at Interspeech 2025