中文

从临床笔记中提取乳腺癌表型:大语言模型与经典本体方法的比较

计算与语言 2026-04-09 v1 人工智能

摘要

肿瘤科电子病历(EMRs)中存储的大量数据包含于非结构化的提供者笔记中——包括但不限于化疗(或癌症治疗)结果、不同生物标志物、肿瘤位置、大小以及患者的生长模式。临床研究表明,大多数肿瘤科医生更倾向于以自然语言而非EMR中的相关结构化字段来提供这些有价值的见解。本研究的主要贡献是报告了一个基于LLM的框架,用于处理提供者笔记并提取上述有价值的医学知识和表型,重点聚焦于肿瘤学领域。在本文中,我们聚焦于使用LLM框架提取乳腺癌相关表型,然后将其性能与先前使用知识驱动标注系统配合NCIt本体标注器的研究进行比较。研究结果表明,基于LLM的信息提取框架可以轻松适配以提取表型,其准确度与经典基于本体的方法相当。然而,一旦训练完成,它们可以轻松微调以适应其他癌症类型和疾病。

关键词

引用

@article{arxiv.2604.06208,
  title  = {Extracting Breast Cancer Phenotypes from Clinical Notes: Comparing LLMs with Classical Ontology Methods},
  author = {Abdullah Bin Faiz and Arbaz Khan Shehzad and Asad Afzal and Momin Tariq and Muhammad Siddiqi and Muhammad Usamah Shahid and Maryam Noor Awan and Muddassar Farooq},
  journal= {arXiv preprint arXiv:2604.06208},
  year   = {2026}
}