结合最优传输域适应与多模态融合的上下文感知注意力层用于自发语音痴呆识别
计算与语言
2023-08-24 v2
摘要
阿尔茨海默病(AD)是一种复杂的神经认知疾病,也是痴呆的主要成因。尽管已有许多研究致力于通过自发语音诊断痴呆,仍存在局限。现有的最先进多模态方法分别训练语言与声学模型,采用多数投票策略,并在输入级(即早期融合)或训练期间拼接不同模态的表示。此外,其中部分方法采用自注意力层,在不考虑上下文信息的情况下计算表示间依赖。并且,此前工作均未考虑模型校准。为应对这些局限,我们提出若干检测AD患者的新方法,以捕获模态内与跨模态交互。首先,我们将音频文件转换为对数梅尔谱图、其一阶与二阶差分,由此为每音频文件创建含三通道的图像。接着,我们分别将每个文本转录与图像通过BERT与DeiT模型。之后,采用基于上下文的自注意力层、带门控模型的自注意力层以及最优传输域适应方法来捕获模态内与模态间交互。最后,我们利用两种方法来融合自注意力与交叉注意力特征。为考虑模型校准,我们应用标签平滑。我们同时使用性能与校准指标。在ADReSS与ADReSSo挑战数据集上的实验表明,所引入方法优于现有研究,最佳模型准确率与F1分数分别达91.25%与91.06%。
引用
@article{arxiv.2305.16406,
title = {Context-aware attention layers coupled with optimal transport domain adaptation and multimodal fusion methods for recognizing dementia from spontaneous speech},
author = {Loukas Ilias and Dimitris Askounis},
journal= {arXiv preprint arXiv:2305.16406},
year = {2023}
}
备注
Knowledge-Based Systems