中文

早期认知衰退的语言指示器:基于DementiaBank佩特语料库的统计与机器学习研究

计算与语言 2026-02-12 v1 人工智能

摘要

背景:精神语言生产的细微变化是认知衰退的最早指标之一。识别认知衰退的语言可解释性标记,可支持透明且临床导向的筛查方法。方法:本研究使用三种语言表示形式分析DementiaBank佩特语料库中的自发语音转录文本:原始清理文本、结合词汇和语法信息的词性(POS)增强表示,以及仅含语法信息的POS表示。评估Logistic回归和随机森林模型,分别采用转录级别的训练-测试划分和主体级别的五折交叉验证,以防止说话者重叠。通过全局特征重要性检验模型可解释性,并使用Mann-Whitney U检验和Cliff's delta效应大小进行统计验证。结果:在各种表示形式下,模型均实现了稳定的性能,语法和语法特征即使在没有词汇内容时也保留了强大的判别能力。主体级别的评估结果更保守但一致,特别是对于POS增强和POS-only表示。统计分析揭示了功能词使用、词汇多样性、句子结构和话语连贯性之间存在显著的组差异,这与机器学习特征重要性发现相吻合。结论:本研究表明,抽象语言特征在临床实用评估下捕获了早期认知衰退的稳健标记。通过结合可解释机器学习与非参数统计验证,本研究支持语言导向特征用于透明可靠的语言基于认知筛查。

关键词

引用

@article{arxiv.2602.11028,
  title  = {Linguistic Indicators of Early Cognitive Decline in the DementiaBank Pitt Corpus: A Statistical and Machine Learning Study},
  author = {Artsvik Avetisyan and Sachin Kumar},
  journal= {arXiv preprint arXiv:2602.11028},
  year   = {2026}
}