使用大型语言模型和BioBERT对电子健康记录中的癌症诊断进行分类:模型性能评估研究
计算与语言
2025-10-16 v1 人工智能
机器学习
摘要
电子健康记录包含结构不一致或自由文本的数据,需要高效的预处理才能启用预测性医疗模型。尽管人工智能驱动的自然语言处理工具在自动诊断分类方面显示出前景,但其比较性能和临床可靠性需要系统评估。本研究的目的是评估4种大型语言模型(GPT-3.5、GPT-4o、Llama 3.2和Gemini 1.5)以及BioBERT在从结构化和非结构化电子健康记录数据中对癌症诊断进行分类时的性能。我们分析了来自3456份癌症患者记录中的762个独特诊断(326个国际疾病分类(ICD)代码描述,436个自由文本条目)。测试了模型将诊断分类到14个预定义类别中的能力。两位肿瘤学专家验证了分类结果。BioBERT在ICD代码上取得了最高的加权宏F1分数(84.2),并在ICD代码准确率(90.8)上与GPT-4o持平。对于自由文本诊断,GPT-4o在加权宏F1分数(71.8 vs 61.5)上优于BioBERT,并取得了略高的准确率(81.9 vs 81.6)。GPT-3.5、Gemini和Llama在两种格式上的整体表现均较低。常见的错误分类模式包括转移瘤与中枢神经系统肿瘤之间的混淆,以及涉及模糊或重叠临床术语的错误。尽管当前性能水平似乎足以用于行政和研究用途,但可靠的临床应用将需要标准化的文档实践以及对高风险决策进行强有力的人工监督。
引用
@article{arxiv.2510.12813,
title = {Cancer Diagnosis Categorization in Electronic Health Records Using Large Language Models and BioBERT: Model Performance Evaluation Study},
author = {Soheil Hashtarkhani and Rezaur Rashid and Christopher L Brett and Lokesh Chinthala and Fekede Asefa Kumsa and Janet A Zink and Robert L Davis and David L Schwartz and Arash Shaban-Nejad},
journal= {arXiv preprint arXiv:2510.12813},
year = {2025}
}
备注
8 Pages