面向自动癌症分期和生物标志物抽取的 LoRA 微调多任务 LLM
机器学习
2026-04-16 v1
摘要
病理报告作为乳腺癌分期的 definitive record,却因其非结构化格式而阻碍大规模数据整理。虽然大型语言模型(LLM)提供了语义推理能力,但其部署往往受限于高计算成本和幻觉风险。本研究引入一个参数高效、多任务框架,用于自动提取肿瘤-淋巴结-转移(TNM)分期、组织学分级和生物标志物。我们对 Llama-3-8B-Instruct 编码器使用 Low-Rank Adaptation(LoRA)在经专家验证的 10,677 份报告数据集上进行微调。不同于生成式方法,我们的架构利用平行分类头以确保 schema 一致性。实验结果表明,该模型实现了 0.976 的 Macro F1 分数,成功解决了复杂语境歧义和异构报告格式,这些都是传统抽取方法(包括基于规则的自然语言处理管道、零-shot LLM 和单任务 LLM 基线)所难以应对的挑战。该提出的高效、多任务架构实现了可靠、可扩展的病理学衍生癌症分期和生物标志物轮廓,具有提升临床决策支持、加速数据驱动的肿瘤学研究潜力。
引用
@article{arxiv.2604.13328,
title = {Multi-Task LLM with LoRA Fine-Tuning for Automated Cancer Staging and Biomarker Extraction},
author = {Jiahao Shao and Anam Nawaz Khan and Christopher Brett and Tom Berg and Xueping Li and Bing Yao},
journal= {arXiv preprint arXiv:2604.13328},
year = {2026}
}
备注
11 pages, 3 figures and 4 tables in the main manuscript. Additional content, figures and tables are in supplementary material section. 17 pages in total