中文

利用表格 LLM 在生物标志物数据上实现少样本阿尔茨海默病诊断

计算与语言 2025-10-16 v2 机器学习 定量方法

摘要

阿尔茨海默病(AD)是一种复杂的神经退行性疾病,其早期准确诊断需要对通常以表格格式表示的异质性生物标志物(如神经影像、遗传风险因素、认知测试和脑脊液蛋白质)进行分析。大型语言模型(LLM)凭借灵活的少样本推理、多模态集成和基于自然语言的可解释性,为利用结构化生物医学数据进行预测提供了前所未有的机遇。我们提出了一个名为 TAP-GPT(Tabular Alzheimer's Prediction GPT)的新框架,该框架将 TableGPT2(一种最初为商业智能任务开发的多模态表格专用 LLM)适配用于基于小样本结构化生物标志物数据的 AD 诊断。我们的方法利用来自结构化生物医学数据的上下文学习示例构建少样本表格提示,并通过参数高效的 qLoRA 适配对 TableGPT2 进行微调,以执行 AD 或认知正常(CN)的临床二分类任务。TAP-GPT 框架利用了 TableGPT2 强大的表格理解能力和 LLM 编码的先验知识,其表现优于更先进的通用 LLM 和为预测任务开发的表格基础模型(TFM)。据我们所知,这是首次将 LLM 应用于使用表格生物标志物数据的预测任务,为未来生物医学信息学中 LLM 驱动的多智能体框架铺平了道路。

关键词

引用

@article{arxiv.2507.23227,
  title  = {Enabling Few-Shot Alzheimer's Disease Diagnosis on Biomarker Data with Tabular LLMs},
  author = {Sophie Kearney and Shu Yang and Zixuan Wen and Bojian Hou and Duy Duong-Tran and Tianlong Chen and Jason Moore and Marylyn Ritchie and Li Shen},
  journal= {arXiv preprint arXiv:2507.23227},
  year   = {2025}
}

备注

accepted by ACM-BCB'25: ACM Conference on Bioinformatics, Computational Biology, and Health Informatics [ACM SIGBio Best Paper Award]