利用患者语音转录文本与音频数据探索多模态阿尔茨海默病检测方法
音频与语音处理
2023-07-07 v1 人工智能
声音
摘要
阿尔茨海默病(AD)是一种常见的痴呆症,严重影响患者健康。由于AD损害患者的语言理解与表达能力,AD患者的语音可作为该疾病的指示信号。本研究利用来自DementiaBank Pitt数据库的患者的语音与转录文本数据,探究多种AD检测方法。所提方法涉及预训练语言模型与图神经网络(GNN),后者从语音转录文本构建图,并利用GNN提取特征以进行AD检测。采用同义词替换、基于GPT的数据增广器等数据增广技术以解决数据集规模小的问题。还引入了音频数据,并使用WavLM模型提取音频特征。随后利用多种方法将这些特征与文本特征融合。最后,尝试通过将语音转录文本转换回音频,并将其与原始音频进行对比学习(contrastive learning)的对比学习方法。我们对上述方法进行了充分的实验与分析。我们的发现揭示了利用语音与音频数据进行AD检测所面临的挑战与潜在解决方案。
引用
@article{arxiv.2307.02514,
title = {Exploring Multimodal Approaches for Alzheimer's Disease Detection Using Patient Speech Transcript and Audio Data},
author = {Hongmin Cai and Xiaoke Huang and Zhengliang Liu and Wenxiong Liao and Haixing Dai and Zihao Wu and Dajiang Zhu and Hui Ren and Quanzheng Li and Tianming Liu and Xiang Li},
journal= {arXiv preprint arXiv:2307.02514},
year = {2023}
}