通过开源大语言模型从放射报告中追踪癌症:长时段信息抽取
计算与语言
2026-03-12 v2
摘要
放射报告捕获了肿瘤负荷、治疗反应和疾病进展的关键长时段信息,但其非结构化叙述格式使自动化分析复杂化。虽然大语言模型(LLM)已推进临床文本处理,但大多数最先进系统仍为专有软件,在隐私敏感的医疗环境中受限。我们提出一个完全开源、可本地部署的管线,用于从放射报告中进行长时段信息抽取,基于llm_extractinator框架实现。该系统应用qwen2.5-72b模型按RECIST标准从不同时间点抽取并关联靶标、非靶标及新病灶数据。评估于50对荷兰CT胸腹部报告配对,抽取性能优异,靶标病灶、非靶标病灶和新病灶的属性水平准确率分别为93.7%、94.9%和94.0%。该方法表明开源LLM可在多时段肿瘤学任务中实现临床意义的性能,同时确保数据隐私和可重复性。这些结果凸显了在常规临床文本中从可扩展抽取结构化长时段数据的潜力。
引用
@article{arxiv.2603.09638,
title = {Tracking Cancer Through Text: Longitudinal Extraction From Radiology Reports Using Open-Source Large Language Models},
author = {Luc Builtjes and Alessa Hering},
journal= {arXiv preprint arXiv:2603.09638},
year = {2026}
}
备注
6 pages, 2 figures