中文

超越表面形式:用于从自发语音检测阿尔茨海默病的语义分析流程

计算与语言 2025-12-16 v1

摘要

阿尔茨海默病(AD)是一种进行性神经退行性疾病,会损害认知能力。语言相关变化可通过语言评估任务(如图片描述)的输出自动识别。语言模型有望作为 AD 筛查工具的基础,但其有限的解释性使得区分认知衰退的真实语言标记与表面级文本模式成为挑战。为解决此问题,我们研究了表面形式变化如何影响分类性能,旨在评估语言模型表示底层语义指标的能力。我们提出了一种新方法,通过改变句法和词汇来转换文本的表面形式,同时保留语义内容。这些变换显著改变了结构和词汇内容,如低 BLEU 和 chrF 分数所示,但保留了底层语义,如高语义相似度分数所示,从而隔离了语义信息的影响,发现模型的表现与使用原始文本时几乎相同,仅在 macro-F1 上有微小偏差。我们还研究了图片描述中的语言是否保留了足够的细节以通过生成模型重建原始图像。我们发现基于图像的变换引入了大量噪声,降低了分类准确率。我们的方法学提供了一种审视影响模型预测特征的新方式,并允许去除可能的虚假相关。我们发现仅使用语义信息,基于语言模型的分类器仍能检测 AD。这项工作表明难以检测到的语义损伤可以被识别,解决了语言退化中被忽视的特征,为早期检测系统开辟了新途径。

关键词

引用

@article{arxiv.2512.13685,
  title  = {Beyond surface form: A pipeline for semantic analysis in Alzheimer's Disease detection from spontaneous speech},
  author = {Dylan Phelps and Rodrigo Wilkens and Edward Gow-Smith and Lilian Hubner and Bárbara Malcorra and César Rennó-Costa and Marco Idiart and Maria-Cruz Villa-Uriol and Aline Villavicencio},
  journal= {arXiv preprint arXiv:2512.13685},
  year   = {2025}
}