基于不确定性音素难度分数的非规范语音数据高效 ASR 个性化
音频与语音处理
2026-03-17 v2 人工智能
声音
摘要
ASR 系统由于声学高变异性和数据稀缺而难以处理非规范语音。我们提出了一种利用音素级不确定性指导微调的的数据高效个性化方法。与计算昂贵的集成方法不同,我们利用变分低秩适应(VI LoRA)来估计基础模型中的认知不确定性。这些估计值形成一个复合的音素难度分数(PhDScore),驱动定向过采样策略。在英语和德语数据集上评估,包括与一年前两份临床报告的纵向分析,我们证明:(1)基于 VI LoRA 的不确定性比标准熵更符合专家临床评估;(2)PhDScore 捕捉了稳定的、持续的构音困难;(3)不确定性引导的采样显著改善了障碍语音的 ASR 准确率。
引用
@article{arxiv.2509.20396,
title = {Data-Efficient ASR Personalization for Non-Normative Speech Using an Uncertainty-Based Phoneme Difficulty Score for Guided Sampling},
author = {Niclas Pokel and Pehuén Moure and Roman Böhringer and Yingqiang Gao},
journal= {arXiv preprint arXiv:2509.20396},
year = {2026}
}