利用大语言模型为 PET 报告自动生成个性化印象
摘要
在本研究中,我们旨在确定微调大语言模型(LLM)是否能生成准确、个性化的全身 PET 报告印象。使用教师强制(teacher-forcing)算法在 PET 报告语料库上训练了十二个语言模型,以报告发现作为输入、临床印象作为参考。一个额外的输入 token 编码阅片医师身份,使模型能够学习医师特定的报告风格。我们的语料库包含 2010 至 2022 年间从本机构收集的 37,370 份回顾性 PET 报告。为确定最佳 LLM,将 30 个评估指标与两位核医学(NM)医师的质量评分进行基准比对,以最对齐的指标选定模型进行专家评估。在一个数据子集中,由三位 NM 医师根据 6 个质量维度(3 分制)和总体效用评分(5 分制)评估模型生成的印象与原始临床印象。每位医师审阅 12 份自己的报告和 12 份其他医师的报告。使用 bootstrap 重采样进行统计分析。在所有评估指标中,领域自适应的 BARTScore 和 PEGASUSScore 与医师偏好显示出最高的 Spearman 秩相关(0.568 和 0.563)。基于这些指标,微调的 PEGASUS 模型被选为最佳 LLM。当医师以自身风格审阅 PEGASUS 生成的印象时,89% 被认为临床可接受,平均效用评分为 4.08(满分 5)。医师将这些个性化印象的总体效用评为与其他医师口述的印象相当(4.03,P=0.41)。总之,PEGASUS 生成的个性化印象具有临床实用性,凸显了其加速 PET 报告的潜力。
引用
@article{arxiv.2309.10066,
title = {Automatic Personalized Impression Generation for PET Reports Using Large Language Models},
author = {Xin Tie and Muheon Shin and Ali Pirasteh and Nevein Ibrahim and Zachary Huemann and Sharon M. Castellino and Kara M. Kelly and John Garrett and Junjie Hu and Steve Y. Cho and Tyler J. Bradshaw},
journal= {arXiv preprint arXiv:2309.10066},
year = {2024}
}
备注
25 pages in total. 6 figures and 3 tables in the main body. The manuscript has been submitted to a journal for potential publication