中文

基于语音与文本的多模态阿尔茨海默病检测

机器学习 2021-08-03 v3 计算与语言

摘要

即使在今天,阿尔茨海默病(AD)前驱期的可靠检测仍然困难,因为与其他神经认知障碍不同,AD 没有体内确诊方法。在此背景下,现有研究表明患者即使在轻度 AD 状态下也常出现语言障碍。我们提出一种利用语音及相应转录文本同时检测 AD 的多模态深度学习方法。对于音频信号,所提基于音频的网络——一种基于卷积神经网络(CNN)的模型——预测多个语音段的诊断,并将其组合用于最终预测。类似地,我们使用从 BERT 提取的上下文嵌入与 CNN 生成的嵌入拼接来对转录文本分类。两个模型的独立预测随后组合以做出最终分类。我们还进行了实验,分析当文本模型使用自动语音识别(ASR)系统生成的转录文本替代人工转录时的模型表现。所提方法在 Dementiabank Pitt 语料库上训练和评估时取得了 85.3% 的 10 折交叉验证准确率。

关键词

引用

@article{arxiv.2012.00096,
  title  = {Multi-Modal Detection of Alzheimer's Disease from Speech and Text},
  author = {Amish Mittal and Sourav Sahoo and Arnhav Datar and Juned Kadiwala and Hrithwik Shalu and Jimson Mathew},
  journal= {arXiv preprint arXiv:2012.00096},
  year   = {2021}
}

备注

9 pages, 3 figures, Accepted in BIOKDD 2021