基于55万条构音障碍语音样本的可懂度分类器
音频与语音处理
2023-03-17 v2 声音
摘要
我们基于 468 名不同说话人贡献的 551,176 条构音障碍语音样本开发了构音障碍语音可懂度分类器,这些说话人具有一系列自我报告的言语障碍,并按五分制对其整体可懂度进行评分。我们遵循不同深度学习方法训练了三个模型,并在来自 100 名说话人的约 94K 条语音上进行了评估。我们进一步发现,这些模型在 TORGO 数据库(100% 准确率)、UASpeech(0.93 相关性)、ALS-TDI PMP(0.81 AUC)数据集以及我们收集的真实非提示语音数据集(106 名构音障碍与 76 名对照说话人,约 2300 条样本)上均具有良好泛化能力(无需进一步训练)。
引用
@article{arxiv.2303.07533,
title = {Speech Intelligibility Classifiers from 550k Disordered Speech Samples},
author = {Subhashini Venugopalan and Jimmy Tobin and Samuel J. Yang and Katie Seaver and Richard J. N. Cave and Pan-Pan Jiang and Neil Zeghidour and Rus Heywood and Jordan Green and Michael P. Brenner},
journal= {arXiv preprint arXiv:2303.07533},
year = {2023}
}
备注
ICASSP 2023 camera-ready