增强 e-Health 环境中构音障碍者的 AAC 软件:基于 TORGO 的评估
计算与语言
2024-11-11 v2 人机交互
声音
音频与语音处理
摘要
患有脑瘫(CP)和肌萎缩侧索硬化症(ALS)的个体经常面临发音困难,导致构音障碍并产生异常语音模式。在医疗环境中,沟通中断会降低护理质量。在构建辅助与替代沟通(AAC)工具以实现流畅沟通的过程中,我们发现最先进的(SOTA)自动语音识别(ASR)技术如 Whisper 和 Wav2vec2.0 由于缺乏训练数据而严重边缘化异常说话者。我们的工作利用 SOTA ASR followed by 领域特定的错误纠正来改善识别效果。英语构音障碍 ASR 性能通常在 TORGO 数据集上评估。该数据集存在一个众所周知的问题——提示重叠,即训练与测试说话者之间的短语重叠。我们的工作提出了一种打破提示重叠的算法。在减少提示重叠后,使用 SOTA ASR 模型的结果对轻度和重度构音障碍说话者产生了极高的词错误率。此外,为改善 ASR,我们研究了 n-gram 语言模型以及基于大语言模型(LLM)的多模态生成式错误纠正算法(如 Whispering-LLaMA)在二次 ASR 中的影响。我们的工作强调了在 ASR 方面仍需做大量工作以改善异常说话者的识别效果,从而实现面对面和 e-Health 环境中的公平医疗可及性。
引用
@article{arxiv.2411.00980,
title = {Enhancing AAC Software for Dysarthric Speakers in e-Health Settings: An Evaluation Using TORGO},
author = {Macarious Hui and Jinda Zhang and Aanchan Mohan},
journal= {arXiv preprint arXiv:2411.00980},
year = {2024}
}