中文

利用对噪声输入鲁棒的声学、词汇、不流利与语音停顿特征识别阿尔茨海默症痴呆

计算与语言 2021-07-01 v1 声音 音频与语音处理

摘要

我们提出了两种基于多模态融合的深度学习模型,它们同时消费 ASR 转写的语音与声学数据,以在结构化诊断任务中分类说话者是否患有阿尔茨海默症及其程度,并在 ADReSSo 2021 挑战赛数据上进行了评估。我们的最佳模型是一个带有高速层(highway layers)的 BiLSTM,使用词语、词语概率、不流利特征、停顿信息以及多种声学特征,在 MMSE 认知分数上达到了 84% 的准确率与 4.26 的 RMSE 误差预测。尽管预测认知衰退更具挑战性,我们的模型通过多模态方法与词语概率、不流利及停顿信息相比仅用词语的模型有所提升。我们展示了使用多模态融合与门控在 AD 分类上的显著收益,其能有效应对来自声学特征与 ASR 假设的噪声输入。

关键词

引用

@article{arxiv.2106.15684,
  title  = {Alzheimer's Dementia Recognition Using Acoustic, Lexical, Disfluency and Speech Pause Features Robust to Noisy Inputs},
  author = {Morteza Rohanian and Julian Hough and Matthew Purver},
  journal= {arXiv preprint arXiv:2106.15684},
  year   = {2021}
}

备注

INTERSPEECH 2021. arXiv admin note: substantial text overlap with arXiv:2106.09668