利用对噪声输入鲁棒的声学、词汇、不流利与语音停顿特征识别阿尔茨海默症痴呆
计算与语言
2021-07-01 v1 声音
音频与语音处理
摘要
我们提出了两种基于多模态融合的深度学习模型,它们同时消费 ASR 转写的语音与声学数据,以在结构化诊断任务中分类说话者是否患有阿尔茨海默症及其程度,并在 ADReSSo 2021 挑战赛数据上进行了评估。我们的最佳模型是一个带有高速层(highway layers)的 BiLSTM,使用词语、词语概率、不流利特征、停顿信息以及多种声学特征,在 MMSE 认知分数上达到了 84% 的准确率与 4.26 的 RMSE 误差预测。尽管预测认知衰退更具挑战性,我们的模型通过多模态方法与词语概率、不流利及停顿信息相比仅用词语的模型有所提升。我们展示了使用多模态融合与门控在 AD 分类上的显著收益,其能有效应对来自声学特征与 ASR 假设的噪声输入。
引用
@article{arxiv.2106.15684,
title = {Alzheimer's Dementia Recognition Using Acoustic, Lexical, Disfluency and Speech Pause Features Robust to Noisy Inputs},
author = {Morteza Rohanian and Julian Hough and Matthew Purver},
journal= {arXiv preprint arXiv:2106.15684},
year = {2021}
}
备注
INTERSPEECH 2021. arXiv admin note: substantial text overlap with arXiv:2106.09668