基于张量融合层的多模态自发性语音痴呆检测方法
计算与语言
2022-11-09 v1 计算机视觉与模式识别
声音
音频与语音处理
摘要
阿尔茨海默病(AD)是一种进行性神经系统疾病,意味着症状会逐年逐渐发展。它也是痴呆症的主要原因,影响记忆、思维能力和心智能力。如今,研究人员已将兴趣转向通过自发性语音进行 AD 检测,因为这构成了一种省时有效的过程。然而,现有的最先进工作提出的多模态方法并未考虑模态间和模态内的交互,而是提出早期和晚期融合方法。为了解决这些局限性,我们提出了深度神经网络,该网络可以端到端训练,并捕获模态间和模态内的交互。首先,每个音频文件被转换为一个由三个通道组成的图像,即对数梅尔谱图、差分和二阶差分。接下来,每个转录文本通过一个 BERT 模型,然后通过一个门控自注意力层。类似地,每个图像通过一个 Swin Transformer,然后通过一个独立的门控自注意力层。同时从每个音频文件中提取声学特征。最后,来自不同模态的表示向量被馈送到一个张量融合层,以捕获模态间的交互。在 ADReSS 挑战数据集上进行的大量实验表明,我们引入的方法相较于现有研究方案获得了显著优势,准确率和 F1 分数分别高达 86.25% 和 85.48%。
引用
@article{arxiv.2211.04368,
title = {A Multimodal Approach for Dementia Detection from Spontaneous Speech with Tensor Fusion Layer},
author = {Loukas Ilias and Dimitris Askounis and John Psarras},
journal= {arXiv preprint arXiv:2211.04368},
year = {2022}
}
备注
2022 IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI) - Oral Presentation