ELM:面向流行病学癌症登记的语言模型混合集成用于肿瘤分组分类
计算与语言
2026-03-20 v2 人工智能
机器学习
摘要
背景:人群基准癌症登记(PBCRs)需从非结构化病理报告中手动提取数据,这一过程耗时 labor-intensive,给大约10万份报告分配到肿瘤分组可能耗费约900人小时。在中等规模的登记中心,当前的自动化规则驱动系统难以处理此分类任务的语言复杂性。材料与方法:我们提出了ELM(语言模型集成),一种新型混合方法,结合小型编码器语言模型和大型语言模型(LLM)。ELM采用包含六个微调编码器模型的集成:三个分析每个报告的前部分,三个分析后部分,以在标记限制条件下最大化文本覆盖。当至少五个模型一致时,分配肿瘤分组;否则,LLM 使用受约束的提示进行仲裁。结果:在覆盖19个肿瘤分组的2058份保存的测试报告上,ELM 实现了加权精确率和召回率为0.94,显著优于仅用编码器的集成(0.91 F1得分)和规则驱动方法。ELM 在 particularly 具有挑战性的类别中表现突出,包括白血病(F1: 0.76 提升至 0.88)、淋巴瘤(0.76 提升至 0.89)以及皮肤癌(0.44 提升至 0.58)。讨论:部署于不列颠哥伦比亚癌症登记中心后,ELM 已将人工审查需求降低约60%-70%,年节省约900人小时,同时保持数据质量标准。结论:ELM 是首个在真实世界PBCR环境中成功部署的小型编码器模型-LLM混合架构,用于肿瘤分组分类,展示了如何通过战略性地组合语言模型实现高精度和操作效率。
引用
@article{arxiv.2503.21800,
title = {ELM: A Hybrid Ensemble of Language Models for Automated Tumor Group Classification in Population-Based Cancer Registries},
author = {Lovedeep Gondara and Jonathan Simkin and Shebnum Devji and Gregory Arbour and Raymond Ng},
journal= {arXiv preprint arXiv:2503.21800},
year = {2026}
}