中文

利用自然语言处理从阿尔茨海默病患者的临床笔记中提取睡眠信息

计算与语言 2024-03-18 v2 人工智能

摘要

阿尔茨海默病(AD)是美国最常见的痴呆形式。睡眠是与生活方式相关的因素之一,已被证明对老年期最佳认知功能至关重要。然而,缺乏研究睡眠与 AD 发病率之间关联的工作。开展此类研究的一个主要瓶颈是,传统获取睡眠信息的方式耗时、低效、不可扩展,且局限于患者的主观体验。我们从 adSLEEP(一个从匹兹堡大学医学中心(UPMC)检索的包含 7266 名 AD 患者、192000 份去标识化临床笔记的语料库)中手动标注 570 份随机抽样的临床笔记文档,创建了金标准数据集。我们开发了基于规则的自然语言处理(NLP)算法、机器学习模型以及基于大语言模型(LLM)的 NLP 算法,以从该金标准数据集中自动提取睡眠相关概念,包括打鼾、午睡、睡眠问题、睡眠质量差、日间嗜睡、夜间觉醒和睡眠时长。基于规则的 NLP 算法在所有睡眠相关概念上取得了最佳的 F1 值。在阳性预测值(PPV)方面,基于规则的 NLP 算法在日间嗜睡和睡眠时长上达到 1.00,机器学习模型:午睡 0.95、睡眠质量差 0.86、打鼾 0.90;微调后的 LLAMA2 在夜间觉醒上达到 PPV 0.93、睡眠问题 0.89、睡眠时长 1.00。结果表明,基于规则的 NLP 算法在所有睡眠概念上始终取得最佳性能。本研究聚焦于 AD 患者的临床笔记,但可扩展至其他疾病的通用睡眠信息提取。

关键词

引用

@article{arxiv.2204.09601,
  title  = {Extraction of Sleep Information from Clinical Notes of Patients with Alzheimer's Disease Using Natural Language Processing},
  author = {Sonish Sivarajkumar and Thomas Yu CHow Tam and Haneef Ahamed Mohammad and Samual Viggiano and David Oniani and Shyam Visweswaran and Yanshan Wang},
  journal= {arXiv preprint arXiv:2204.09601},
  year   = {2024}
}