中文

语法之声:语言模型的微调与综合评估用于语音病理学

计算与语言 2025-10-09 v2 人工智能 声音 音频与语音处理

摘要

根据美国国立卫生研究院的数据,超过 340 万儿童经历语言障碍,需要临床干预。语音语言病理学家(SLP)的数量大约是受影响儿童数量的 1/20,这凸显了儿童护理之间的显著差距,以及迫切需要提升 SLP 生产力的技术支持。虽然最先进的多模态语言模型(MLM)在支持 SLP 方面显示出前景,但由于对其在高风险临床环境中性能的有限理解,其实际应用仍属未被充分探索。为此,我们与领域专家合作,开发了 MLM 在语音语言病理学中实际应用场景的分类框架。基于此分类框架,我们引入了首个全面评估 MLM 在五个核心应用场景下的基准数据集,其中每个场景包含 1000 条手动标注的数据点。该基准包括在各种设置下的鲁棒性和灵敏性测试,包括背景噪声、说话人性别和方言。我们评估了 15 个最先进的 MLM,发现没有单一模型在所有任务中始终均优于其他模型。值得注意的是,我们发现系统性差异,即模型在男性说话人方面表现更好;同时观察到链式思维提示可能会导致大标签空间和狭窄决策边界的分类任务性能下降。此外,我们研究了在领域特定数据上微调 MLM,实现了相对于基础模型的 10% 以上的提升。这些发现凸显了当前 MLM 在语音语言病理学应用中的潜力与局限,进一步强调了需要进一步研究和针对性开发的重要性。

关键词

引用

@article{arxiv.2509.16765,
  title  = {The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology},
  author = {Fagun Patel and Duc Q. Nguyen and Sang T. Truong and Jody Vaynshtok and Sanmi Koyejo and Nick Haber},
  journal= {arXiv preprint arXiv:2509.16765},
  year   = {2025}
}

备注

EMNLP 2025 Oral Presentation