无需听力图:利用已有得分进行个性化语音可懂度预测
音频与语音处理
2025-06-04 v1 人工智能
声音
摘要
个性化语音可懂度预测具有挑战性。以往的方法主要依赖于听力图,但由于其仅捕获听者对纯音的听力阈值,因此在准确性上存在固有局限。我们并未引入额外的听者特征,而是提出了一种新颖的方法,利用个体已有的可懂度数据来预测其在新音频上的表现。我们提出了基于支持样本的可懂度预测网络(SSIPNet),这是一种深度学习模型,利用语音基础模型从多个支持(音频,得分)对中构建听者语音识别能力的高维表示,从而实现对未见音频的准确预测。在 Clarity Prediction Challenge 数据集上的结果表明,即使使用少量支持(音频,得分)对,我们的方法也优于基于听力图的预测。我们的工作为个性化语音可懂度预测提出了一种新范式。
引用
@article{arxiv.2506.02039,
title = {No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction},
author = {Haoshuai Zhou and Changgeng Mo and Boxuan Cao and Linkai Li and Shan Xiang Wang},
journal= {arXiv preprint arXiv:2506.02039},
year = {2025}
}
备注
Accepted at Interspeech 2025