利用从语言样本中提取的词汇特征自动识别阿尔茨海默病
计算与语言
2023-07-18 v1
摘要
目的:本研究有双重目标。首先,旨在增进对阿尔茨海默病(AD)型痴呆对词汇不同方面影响的理解。其次,旨在证明当此类词汇方面用作机器学习分类器的特征时,可有助于在自动识别AD患者产生的语言样本上达到最先进的性能。方法:数据来源于ADDreSS挑战赛,其为DementiaBank语料库的一部分。所用数据集由Cookie Theft图画描述的转录文本组成,训练部分含54名受试者、测试部分含24名受试者。叙事样本数量为训练集108个、测试集48个。首先,利用数据集的训练与测试部分研究AD对99个选定词汇特征的影响。随后在将AD患者产生的文本样本与正常受试者产生的样本进行分类的任务上进行了若干机器学习实验。开展了多项实验以比较词汇复杂性的不同领域、识别有助于实现最优性能的特征子集,并研究输入规模对分类的影响。为评估基于叙事语音所建模型的泛化能力,使用两位英国作家Iris Murdoch和Agatha Christie的书面数据以及前总统Ronald Reagan部分演讲的转录文本进行了两项泛化测试。结果:仅使用词汇特征,在将AD个体产生的语言样本与健康对照受试者产生的样本分类时,达到了超过91%的最先进分类F1值与准确率。这证实了AD对词汇处理具有实质性影响。
引用
@article{arxiv.2307.08070,
title = {Automatic Identification of Alzheimer's Disease using Lexical Features extracted from Language Samples},
author = {M. Zakaria Kurdi},
journal= {arXiv preprint arXiv:2307.08070},
year = {2023}
}