中文

面向PET/CT报告印象的全面基准与参数高效微调

计算机视觉与模式识别 2026-03-12 v1

摘要

PET/CT成像在肿瘤学和核医学中至关重要,但将复杂发现总结为精确诊断印象的工作负拷重大。虽然大语言模型在医学文本生成方面显示出前景,但其在PET/CT高度专业领域的能力尚未得到充分探索。我们引入PET-F2I-41K(PET发现转印象基准),该基准由超过41,000个真实报告构成,用于PET/CT印象生成。使用PET-F2I-41K,我们对27个模型进行全面评估,包括专有前沿大语言模型、开源通用模型和医学领域大语言模型,并开发了一个来自Qwen2.5-7B-Instruct通过LoRA微调的领域适应模型(PET-F2I-7B)。除标准NLG指标(如BLEU-4、ROUGE-L、BERTScore)外,我们提出了三个临床导向指标——实体覆盖率(ECR)、未覆盖实体率(UER)和事实一致性率(FCR)——以评估诊断完整性和事实可靠性。实验结果表明,无论是前沿模型还是医学领域模型在零样本设置下都表现不佳;相比之下,PET-F2I-7B实现了显著提升(例如0.708的BLEU-4),实体覆盖率提升了3倍,同时在成本、延迟和隐私方面具有优势。除了此建模贡献外,PET-F2I-41K为加速开发可靠且临床可部署的PET/CT报告系统提供了标准化评估框架。

关键词

引用

@article{arxiv.2603.10560,
  title  = {PET-F2I: A Comprehensive Benchmark and Parameter-Efficient Fine-Tuning of LLMs for PET/CT Report Impression Generation},
  author = {Yuchen Liu and Wenbo Zhang and Liling Peng and Yichi Zhang and Yu Fu and Xin Guo and Chao Qu and Yuan Qi and Le Xue},
  journal= {arXiv preprint arXiv:2603.10560},
  year   = {2026}
}