中文

Swin-BERT:用于语音识别阿尔茨海默痴呆症检测的特征融合系统

音频与语音处理 2024-10-11 v1 人工智能 计算与语言 声音

摘要

语音通常用于构建自动阿尔茨海默痴呆症 (AD) 检测系统,因为语音中的声学和语言能力在早期阶段的人群表现出下降。然而,语音不仅包含与认知状态相关的局部和全局信息,还包含与认知状态无关的信息,如年龄和性别。在本文中,我们提出了一个基于语音的系统,命名为 Swin-BERT,用于自动痴呆检测。对于声学部分,采用用于从图像中提取局部和全局信息的移位窗口多头注意力机制,设计了我们的声学系统。为解耦年龄和性别对声学特征提取的影响,这些因素被用作设计的声学系统的额外输入。对于语言部分,去除了语音中在生存于和不生存于 AD 人群之间差异显著的节奏相关信息。为补偿被移除的节奏信息,使用字符级转录作为基于词级 BERT 风格系统的额外输入。最后,Swin-BERT 将从我们提议的声学系统中学习的声学特征与我们的语言系统相结合。实验基于由国际痴呆检测挑战提供的两个数据集进行:ADReSS 和 ADReSSo。结果表明,我们提议的声学和语言系统在这两个数据集上均表现出优于或相当于以往研究的水平。Swin-BERT 系统在 ADReSS 和 ADReSSo 数据集上实现了 85.58% F-score 和 87.32% F-score,性能优于以往工作。

关键词

引用

@article{arxiv.2410.07277,
  title  = {Swin-BERT: A Feature Fusion System designed for Speech-based Alzheimer's Dementia Detection},
  author = {Yilin Pan and Yanpei Shi and Yijia Zhang and Mingyu Lu},
  journal= {arXiv preprint arXiv:2410.07277},
  year   = {2024}
}