使用开源临床大型语言模型进行癌症分期分类
计算与语言
2024-09-04 v1 人工智能
摘要
癌症分期分类对于制定肿瘤患者的治疗和护理管理计划至关重要。分期信息通常以非结构化形式包含在电子健康记录系统的临床、病理、放射学和其他自由文本报告中,需要大量工作来解析和获取。为了促进提取这些信息,先前的自然语言处理方法依赖于标记训练数据集,而准备这些数据集是劳动密集型的。在本研究中,我们证明,无需任何标记训练数据,开源临床大型语言模型(LLM)可以从真实世界病理报告中提取病理肿瘤-淋巴结-转移(pTNM)分期信息。我们的实验比较了LLM和使用标记数据微调的BERT模型。我们的发现表明,尽管LLM在肿瘤(T)分类上仍表现欠佳,但通过适当采用提示策略,它们在转移(M)分类上可以达到可比性能,并在淋巴结(N)分类上表现更优。
引用
@article{arxiv.2404.01589,
title = {Classifying Cancer Stage with Open-Source Clinical Large Language Models},
author = {Chia-Hsuan Chang and Mary M. Lucas and Grace Lu-Yao and Christopher C. Yang},
journal= {arXiv preprint arXiv:2404.01589},
year = {2024}
}
备注
accepted in the IEEE International Conference on Healthcare Informatics (IEEE ICHI 2024)