利用大语言模型对GLP-1RA 案例报告进行时序表型化:文本时间序列语料库与风险建模
计算与语言
2026-04-09 v1 人工智能
摘要
2型糖尿病案例报告描述了复杂的临床进程,但其时间线常以难以在纵向建模中重用的语言表达。为此,我们开发了一个包含136篇PubMed开放获取的单患者案例报告的文本时间序列语料库,涉及胰高岛素样肽1受体激动剂(GLP-1RA),并将临床事件关联到其最可能的参考时间。我们评估了自动LLM时序提取与临床领域专家标注的金标准时间线之间的表现,评估系统在恢复临床事件及其时间方面的能力。最佳表现良好的LLM实现了高事件覆盖率(GPT5; 0.871)和可靠的时序序列 across症状(GPT5; 0.843)、诊断、治疗、实验室检查和结局。作为下游演示,时间-事件分析在糖尿病中提示,GLP-1使用者与非使用者相比,呼吸并发症的风险更低(HR=0.259, p<0.05),与此前报告的改善呼吸结果一致。时序注释和代码将在接受后公开。
引用
@article{arxiv.2604.06197,
title = {Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling},
author = {Sayantan Kumar and Jeremy C. Weiss},
journal= {arXiv preprint arXiv:2604.06197},
year = {2026}
}
备注
AMIA Annual Symposium