中文

利用商业自动语音识别和多模态大语言模型进行构音障碍语音的零样本识别

音频与语音处理 2025-12-22 v1 声音

摘要

基于语音的人机交互是访问智能系统的主要模态,但构音障碍患者由于识别性能差距而面临系统性排斥。虽然自动语音识别(ASR)在典型语音上的词错误率(WER)低于 5%,但对于构音障碍说话者的性能急剧下降。多模态大语言模型(MLLM)有潜力利用上下文推理来补偿声学退化,但其零样本能力尚未得到表征。本研究在 TORGO 构音障碍语音语料库上评估了八种商业语音转文本服务:四种传统 ASR 系统(AssemblyAI、Whisper large-v3、Deepgram Nova-3、Nova-3 Medical)和四种基于 MLLM 的系统(GPT-4o、GPT-4o Mini、Gemini 2.5 Pro、Gemini 2.5 Flash)。评估涵盖词汇准确性、语义保持性和成本-延迟权衡。结果表明退化具有严重程度依赖性:轻度构音障碍的 WER 为 3-5%,接近典型语音基准,而重度构音障碍在所有系统中的 WER 超过 49%。逐字转录提示产生了架构特定效应:GPT-4o 在所有受试说话者中实现了 7.36 个百分点的 WER 降低并保持一致改善,而 Gemini 变体表现出退化。语义指标表明,尽管词汇错误率升高,交流意图仍然可以部分恢复。这些发现建立了经验基线,使辅助语音接口部署的技术选择有据可依。

关键词

引用

@article{arxiv.2512.17474,
  title  = {Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models},
  author = {Ali Alsayegh and Tariq Masood},
  journal= {arXiv preprint arXiv:2512.17474},
  year   = {2025}
}