有用的失误:自动语音识别错误能否改善下游痴呆症分类?
计算与语言
2024-01-12 v1 声音
音频与语音处理
摘要
\textbf{目标}:我们旨在研究自动语音识别(ASR)系统的错误如何影响痴呆症分类准确率,特别是在“Cookie Theft”图片描述任务中。我们旨在评估不完美的 ASR 生成转录是否能提供有价值的信息,以区分认知健康个体与阿尔茨海默病(AD)患者的语言样本。\textbf{方法}:我们使用各种 ASR 模型进行了实验,并通过后期编辑技术完善了其转录。这些不完美的 ASR 转录和手动转录均被用作下游痴呆症分类的输入。我们进行了全面的错误分析,以比较模型性能并评估 ASR 生成转录在痴呆症分类中的有效性。\textbf{结果}:令人惊讶的是,在“Cookie Theft”任务中,不完美的 ASR 生成转录在区分 AD 患者和非 AD 患者方面优于手动转录。这些基于 ASR 的模型超越了之前的最先进方法,表明 ASR 错误可能包含与痴呆症相关的有价值线索。ASR 与分类模型之间的协同作用提高了痴呆症分类的整体准确率。\textbf{结论}:不完美的 ASR 转录有效捕获了与痴呆症相关的语言异常,提高了分类任务的准确率。ASR 与分类模型之间的这种协同作用突显了 ASR 作为评估认知障碍及相关临床应用的宝贵工具的潜力。
引用
@article{arxiv.2401.05551,
title = {Useful Blunders: Can Automated Speech Recognition Errors Improve Downstream Dementia Classification?},
author = {Changye Li and Weizhe Xu and Trevor Cohen and Serguei Pakhomov},
journal= {arXiv preprint arXiv:2401.05551},
year = {2024}
}
备注
To appear on Journal of Biomedical Informatics