中文

LLMCARE:基于 transformer 模型与 LLM 生成合成数据的早期认知功能障碍检测

计算与语言 2025-11-14 v3 人工智能

摘要

阿尔茨海默病及相关痴呆(Alzheimer's disease and related dementias,简称 ADRD)影响约五百万美国老年人,其中超过半数尚未被诊断。基于语音的自然语言处理(NLP)提供了通过细微语言标记实现早期检测认知衰退的可扩展方法。本研究开发并评估了一个结合 transformer 嵌入与手工语言特征、使用大型语言模型(LLM)生成合成数据进行数据增强、以及评估单模态和多模态分类器的语音基准筛查管线。外部验证评估了其在仅包含轻度认知障碍(MCI)队列中的普适性。转录数据来源于 ADReSSo 2021 基准数据集(n=237,Pitt 语料库)和 DementiaBank Delaware 语料库(n=205,MCI 对照组)。测试了十个 transformer 模型,采用三种微调策略。后融合模型将来自最佳 transformer 的嵌入与 110 项语言特征相结合。五个 LLM(LLaMA8B/70B、MedAlpaca7B、Ministral8B、GPT-4o)生成标记条件的合成语音进行数据增强,三个多模态 LLM(GPT-4o、Qwen-Omni、Phi-4)在零样本和微调模式下进行评估。在 ADReSSo 上,融合模型实现 F1=83.3(AUC=89.5),优于 transformer-only 和语言基线。MedAlpaca7B 数据增强(2 倍)提高 F1=85.7,尽管更大规模的增益有所下降。微调提升了单模态 LLM(MedAlpaca7B F1=47.7→78.7),而多模态模型表现较低(Phi-4=71.6;GPT-4o=67.6)。在 Delaware 上,融合加 1 倍 MedAlpaca7B 模型实现 F1=72.8(AUC=69.6)。整合 transformer 与语言特征可提升 ADRD 检测。LLM 基于的数据增强提高了数据效率,但收益有所递减,而当前多模态模型仍受限。针对独立 MCI 队列的验证支持了该管线在可扩展、临床相关的早期筛查方面的潜力。

关键词

引用

@article{arxiv.2508.10027,
  title  = {LLMCARE: early detection of cognitive impairment via transformer models enhanced by LLM-generated synthetic data},
  author = {Ali Zolnour and Hossein Azadmaleki and Yasaman Haghbin and Fatemeh Taherinezhad and Mohamad Javad Momeni Nezhad and Sina Rashidi and Masoud Khani and AmirSajjad Taleban and Samin Mahdizadeh Sani and Maryam Dadkhah and James M. Noble and Suzanne Bakken and Yadollah Yaghoobzadeh and Abdol-Hossein Vahabie and Masoud Rouhizadeh and Maryam Zolnoori},
  journal= {arXiv preprint arXiv:2508.10027},
  year   = {2025}
}