中文

利用预训练网络的多模态特征进行阿尔茨海默症识别

声音 2021-03-04 v2 计算与语言 机器学习 音频与语音处理

摘要

收集与获取大量医疗数据非常耗时费力,不仅因为难以找到特定患者,也因需解决患者病历的保密问题。另一方面,有一些在易收集的大规模数据集(如 Youtube 或 Wikipedia)上训练的深度学习模型可提供有用表征。因此,利用这些预训练网络的特征来处理手头的小数据将极具优势。本工作中,我们利用从预训练网络提取的多种多模态特征,通过神经网络识别阿尔茨海默症,所用小数据集由 INTERSPEECH 2020 的 ADReSS Challenge 提供。该挑战旨在通过提供声学与文本数据来判别疑似阿尔茨海默症患者。借助多模态特征,我们改进一种基于卷积循环神经网络的结构,以同时执行分类与回归任务,并能处理变长对话。我们的测试结果准确率超越基线 18.75%,且回归任务的验证结果显示以 78.70% 准确率区分 4 类认知障碍的可能性。

关键词

引用

@article{arxiv.2009.04070,
  title  = {Exploiting Multi-Modal Features From Pre-trained Networks for Alzheimer's Dementia Recognition},
  author = {Junghyun Koo and Jie Hwan Lee and Jaewoo Pyo and Yujin Jo and Kyogu Lee},
  journal= {arXiv preprint arXiv:2009.04070},
  year   = {2021}
}

备注

In the Proceedings of INTERSPEECH 2020