利用声学单元语言模型的无参考自动语音严重程度评估
声音
2025-10-02 v1
摘要
随着言语障碍带来的经济负担日益加重,语音严重程度评估正变得越来越重要。当前的语音严重程度模型通常难以泛化,学习的是数据集特定的声学线索,而不是语音严重程度的有意义关联。此外,许多模型需要参考语音或转录文本,这限制了它们在具有生态效度的场景(如自发语音评估)中的适用性。先前的研究表明,自动语音自然度评估分数与严重程度评估分数之间存在很强的相关性,这促使我们探索一种不依赖病理语音数据的无参考方法 SpeechLMScore。此外,我们提出了基于 NKI-CCRT 数据集的 NKI-SpeechRT 数据集,为语音严重程度评估提供更全面的基础。本研究评估了 SpeechLMScore 是否优于传统的基于声学特征的方法,并评估了无参考模型与有参考模型之间的性能差距。此外,我们利用 NKI-SpeechRT 数据集中的主观噪声评级来检验噪声对这些模型的影响。结果表明,SpeechLMScore 对噪声具有鲁棒性,并且与传统方法相比具有更优的性能。
引用
@article{arxiv.2510.00639,
title = {Reference-free automatic speech severity evaluation using acoustic unit language modelling},
author = {Bence Mark Halpern and Tomoki Toda},
journal= {arXiv preprint arXiv:2510.00639},
year = {2025}
}
备注
5 pages. Proceedings of the 6th ACM International Conference on Multimedia in Asia Workshops