非典型语音识别的特异性与规范性建模:构音障碍案例研究
声音
2025-09-23 v1 计算与语言
音频与语音处理
摘要
最先进的自动语音识别(ASR)模型,如 Whisper,在非典型语音(例如构音障碍患者产生的语音)上表现不佳。以往针对非典型语音的研究大多探索完全个性化(或特异性)的模型,但既能泛化又能处理特异性的建模策略可能更有效地捕捉非典型语音。为了研究这一点,我们比较了四种策略:(a)在典型语音上训练的模型(无个性化),(b)完全针对个体个性化的模型,(c)在其他构音障碍说话者语音上训练的模型,以及(d)模型,该模型通过首先建模规范模式,然后适应个体语音来结合这些策略。在本案例研究中,我们发现构音障碍-特异性模型的表现优于特异性方法,同时所需的个性化数据不到后者的一半(128条训练数据时词错误率为36.43,而256条时为36.99)。此外,我们发现仅微调语音编码器(而非语言模型解码器)能获得最佳结果,平均将词错误率从71%降至32%。我们的发现突显了利用规范性(跨说话人)和特异性(说话人特定)模式来改善代表性不足的语音人群的ASR的价值。
引用
@article{arxiv.2509.16718,
title = {Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies},
author = {Vishnu Raja and Adithya V Ganesan and Anand Syamkumar and Ritwik Banerjee and H Andrew Schwartz},
journal= {arXiv preprint arXiv:2509.16718},
year = {2025}
}
备注
Will appear in EMNLP 2025 Main Proceedings