中文

有用的失误:自动语音识别错误能否改善下游痴呆症分类?

计算与语言 2024-01-12 v1 声音 音频与语音处理

摘要

\textbf{目标}:我们旨在研究自动语音识别(ASR)系统的错误如何影响痴呆症分类准确率,特别是在“Cookie Theft”图片描述任务中。我们旨在评估不完美的 ASR 生成转录是否能提供有价值的信息,以区分认知健康个体与阿尔茨海默病(AD)患者的语言样本。\textbf{方法}:我们使用各种 ASR 模型进行了实验,并通过后期编辑技术完善了其转录。这些不完美的 ASR 转录和手动转录均被用作下游痴呆症分类的输入。我们进行了全面的错误分析,以比较模型性能并评估 ASR 生成转录在痴呆症分类中的有效性。\textbf{结果}:令人惊讶的是,在“Cookie Theft”任务中,不完美的 ASR 生成转录在区分 AD 患者和非 AD 患者方面优于手动转录。这些基于 ASR 的模型超越了之前的最先进方法,表明 ASR 错误可能包含与痴呆症相关的有价值线索。ASR 与分类模型之间的协同作用提高了痴呆症分类的整体准确率。\textbf{结论}:不完美的 ASR 转录有效捕获了与痴呆症相关的语言异常,提高了分类任务的准确率。ASR 与分类模型之间的这种协同作用突显了 ASR 作为评估认知障碍及相关临床应用的宝贵工具的潜力。

关键词

引用

@article{arxiv.2401.05551,
  title  = {Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?},
  author = {Changye Li and Weizhe Xu and Trevor Cohen and Serguei Pakhomov},
  journal= {arXiv preprint arXiv:2401.05551},
  year   = {2024}
}

备注

To appear on Journal of Biomedical Informatics