失败的另一方面:考察语音识别错误对后续痴呆分类的影响
音频与语音处理
2022-11-15 v1 人工智能
计算与语言
机器学习
定量方法
摘要
自发语音中可检测的语言异常已在包括痴呆及其他认知障碍筛查在内的多种临床应用中展现出潜力。部署可分类大规模临床环境中语音语言样本自动化工具的可行性,取决于能否捕获并自动转写语音以进行后续分析。然而,自监督学习(SSL)自动语音识别(ASR)模型在精心整理语音数据上的优异表现,在来自临床环境的困难语音样本上并不明显。成功将 ASR 模型用于临床应用的关键问题之一是:其生成的不完美转写是否为下游任务提供了足以在可接受精度下运行的信息。本研究中,我们考察若干深度学习 ASR 系统产生的错误及其对痴呆分类下游任务的影响。我们的关键发现之一颇为矛盾:错误率相对较高的 ASR 系统所产生的转写,可带来优于基于逐字转写的分类的下游分类精度。
引用
@article{arxiv.2211.07430,
title = {The Far Side of Failure: Investigating the Impact of Speech Recognition Errors on Subsequent Dementia Classification},
author = {Changye Li and Trevor Cohen and Serguei Pakhomov},
journal= {arXiv preprint arXiv:2211.07430},
year = {2022}
}
备注
Accepted as extended abstract for ML4H 2022