中文

利用微调大语言模型实现可解释的胰腺囊性病变特征提取与风险分类

人工智能 2025-07-29 v1 计算与语言 信息检索

摘要

背景:从放射学报告中手动提取胰腺囊性病变(PCL)特征劳动强度大,限制了推进PCL研究所需的大规模研究。目的:开发并评估能够从MRI/CT报告中自动提取PCL特征并根据指南分配风险类别的大语言模型(LLM)。材料与方法:我们整理了一个包含来自5,134名患者的6,000份腹部MRI/CT报告(2005-2024年)的训练数据集,这些报告描述了PCL。使用GPT-4o通过思维链(CoT)提示生成标签,以提取PCL和主胰管特征。使用QLoRA在GPT-4o生成的CoT数据上微调了两个开源LLM。根据基于2017年ACR白皮书制定的机构指南,将特征映射到风险类别。在285份保留的人工标注报告上进行了评估。三位放射科医生独立审查了100个案例的模型输出。使用精确匹配准确率评估特征提取,使用宏平均F1分数评估风险分类,使用Fleiss' Kappa评估放射科医生与模型之间的一致性。结果:CoT微调提高了LLaMA(80%至97%)和DeepSeek(79%至98%)的特征提取准确率,与GPT-4o(97%)相当。风险分类F1分数也有所提高(LLaMA:0.95;DeepSeek:0.94),与GPT-4o(0.97)非常接近,且无统计学显著差异。放射科医生间阅片一致性高(Fleiss' Kappa = 0.888),并且加入DeepSeek-FT-CoT(Fleiss' Kappa = 0.893)或GPT-CoT(Fleiss' Kappa = 0.897)后无统计学显著差异,表明两个模型都达到了与放射科医生相当的一致性水平。结论:具有CoT监督的微调开源LLM能够为大规模PCL研究实现准确、可解释且高效的表型分析,性能与GPT-4o相当。

关键词

引用

@article{arxiv.2507.19973,
  title  = {Leveraging Fine-Tuned Large Language Models for Interpretable Pancreatic Cystic Lesion Feature Extraction and Risk Categorization},
  author = {Ebrahim Rasromani and Stella K. Kang and Yanqi Xu and Beisong Liu and Garvit Luhadia and Wan Fung Chui and Felicia L. Pasadyn and Yu Chih Hung and Julie Y. An and Edwin Mathieu and Zehui Gu and Carlos Fernandez-Granda and Ammar A. Javed and Greg D. Sacks and Tamas Gonda and Chenchan Huang and Yiqiu Shen},
  journal= {arXiv preprint arXiv:2507.19973},
  year   = {2025}
}