用于核医学报告分类的领域自适应大语言模型
计算与语言
2023-03-03 v1 人工智能
机器学习
摘要
随着基于 transformer 的语言模型在医学中的应用日益增多,尚不清楚这些模型在具有领域特定词汇和独特报告风格的核医学中的泛化能力如何。在本研究中,我们通过对语言模型进行自适应以基于临床 18F-氟脱氧葡萄糖 (FDG) PET/CT 报告预测 5 分 Deauville 评分,评估了核医学中领域自适应的价值。我们回顾性地从临床影像数据库中检索了 2008-2018 年间 4542 份文本报告和 1664 张图像,用于 FDG PET/CT 淋巴瘤检查。从报告中移除 Deauville 评分,然后将报告中剩余文本作为模型输入。使用多个通用 transformer 语言模型将报告分类为 Deauville 评分 1-5。随后我们使用掩码语言建模将模型自适应到核医学领域,并评估其对分类性能的影响。这些语言模型与视觉模型、多模态视觉语言模型以及一名核医学医师进行比较,采用七折蒙特卡洛交叉验证,报告均值与标准差。领域自适应改善了所有语言模型。例如,BERT 在领域自适应后从 61.3% 的五类准确率提升至 65.7%。性能最佳的模型(领域自适应的 RoBERTa)达到了 77.4% 的五类准确率,优于医师表现 (66%)、最佳视觉模型表现 (48.1),并与多模态模型表现 (77.2) 相近。领域自适应提升了大语言模型解读核医学文本报告的性能。
引用
@article{arxiv.2303.01258,
title = {Domain-adapted large language models for classifying nuclear medicine reports},
author = {Zachary Huemann and Changhee Lee and Junjie Hu and Steve Y. Cho and Tyler Bradshaw},
journal= {arXiv preprint arXiv:2303.01258},
year = {2023}
}