基于 E-Branchformer 与多任务学习的失语症语音识别与检测新基准
音频与语音处理
2023-05-24 v1 计算与语言
摘要
失语症是一种影响数百万患者说话能力的语言障碍。本文利用最先进的语音识别技术与 AphsiaBank 数据集,提出了失语症语音识别与检测任务的新基准。具体而言,我们基于 CTC/Attention 架构引入了两种多任务学习方法来同时执行这两项任务。我们的系统在说话人级检测准确率上达到最先进水平(97.3%),并使中度失语症患者的词错率(WER)相对降低 11%。此外,我们将该方法应用于另一 disordered speech 数据库 DementiaBank Pitt 语料库,证明了其泛化能力。我们将公开我们的一站式脚本与预训练模型以促进可复现性。我们的标准化数据预处理流程与开源脚本使研究人员能够直接比较结果,推动 disordered speech 处理领域的进展。
引用
@article{arxiv.2305.13331,
title = {A New Benchmark of Aphasia Speech Recognition and Detection Based on E-Branchformer and Multi-task Learning},
author = {Jiyang Tang and William Chen and Xuankai Chang and Shinji Watanabe and Brian MacWhinney},
journal= {arXiv preprint arXiv:2305.13331},
year = {2023}
}
备注
Accepted at INTERSPEECH 2023. Code: https://github.com/espnet/espnet