中文

针对帕金森病患者的自动语音识别微调:提高语音技术可访问性的有效策略

音频与语音处理 2024-10-01 v1 声音

摘要

本文通过在Speech Accessibility Project(SAP)2023-10-05 数据包上微调预训练的自动语音识别(ASR)模型,来增强对失语及嗓音异常的语音识别能力。该数据包包含253名帕金森病患者的语音。实验测试了对小儿麻痹症有效的方法,包括说话人聚类和严重程度相关模型、加权微调和多任务学习。最佳结果采用多任务学习模型,该模型在训练时会生成说话人障碍严重程度的辅助输出。相较于仅使用 Librispeech 数据微调的基线模型,词错误率显著降低。相对于仅使用100小时和960小时 Librispeech 数据微调的模型,词错误率分别改善了37.62%和26.97%。

关键词

引用

@article{arxiv.2409.19818,
  title  = {Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility},
  author = {Xiuwen Zheng and Bornali Phukon and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2409.19818},
  year   = {2024}
}