中文

面向三维脑CT报告生成的多模态大语言模型综合框架

计算与语言 2025-03-10 v1

摘要

多模态大语言模型(MLLMs)已被赋予自由探索医学应用的任务,主要聚焦于放射学报告生成。然而,针对体积性3D解剖的初步成功尚不足以反映真实世界诊断挑战。为缓解现有文献中三个关键局限方面:(1)数据复杂性,(2)模型容量,(3)评估指标保真度,我们收集了18,885个文本-扫描配对的3D-BrainCT数据集,并应用临床视觉指令调优(CVIT)训练BrainGPT模型以生成符合放射学规范的3D脑CT报告。统计而言,我们的BrainGPT在内部测试中得分BLEU-1 = 44.35,BLEU-4 = 20.38,METEOR = 30.13,ROUGE-L = 47.6,CIDEr-R = 211.77,并在外部验证CQ500数据集上实现了0.91的准确率,用于描述中线位移。通过进一步检查所描述的报告,我们报告称,传统指标仅衡量了表层文本相似性,未能衡量诊断目的的信息密度。为弥合这一差距,我们提出了一种新颖的面向特征的放射学任务评估(FORTE),用于估计报告的临床相关性(病灶特征和解剖标志)。值得注意的是,BrainGPT模型在平均FORTE F1得分上得分0.71(degree=0.661;landmark=0.706;feature=0.693;impression=0.779)。为证明BrainGPT模型具备生成类人放射学报告的客观准备,我们进行了一次包含11名医生评估者的图灵测试,约74%的BrainGPT生成的描述与人类所写内容无法区分。我们的工作体现了一个综合框架,展示了 curating 3D脑CT数据集、微调解剖感知语言模型以及提出稳健放射学评估指标的首次实践经验。

关键词

引用

@article{arxiv.2407.02235,
  title  = {Towards a Holistic Framework for Multimodal Large Language Models in Three-dimensional Brain CT Report Generation},
  author = {Cheng-Yi Li and Kao-Jung Chang and Cheng-Fu Yang and Hsin-Yu Wu and Wenting Chen and Hritik Bansal and Ling Chen and Yi-Ping Yang and Yu-Chun Chen and Shih-Pin Chen and Jiing-Feng Lirng and Kai-Wei Chang and Shih-Hwa Chiou},
  journal= {arXiv preprint arXiv:2407.02235},
  year   = {2025}
}

备注

6 figures, 5 supplementary figures, 8 supplementary tables