CheX-GPT:利用大语言模型增强胸部 X 光报告标注
计算与语言
2024-11-07 v2 信息检索
摘要
自由文本放射学报告为各种医疗任务提供了丰富的数据源,但有效地对这些文本进行标注仍然具有挑战性。传统的基于规则的标注方法无法捕捉多样自由文本模式的细微差别。此外,使用专家标注数据的模型受到数据稀缺和预定义类别的限制,影响了其性能、灵活性和可扩展性。为了解决这些问题,我们的研究提供了三个主要贡献:1) 我们展示了使用精心设计的提示时 GPT 作为熟练标注器的潜力。2) 仅使用 GPT 标注的数据,我们训练了一个基于 BERT 的标注器 CheX-GPT,其运行速度比 GPT 对应模型更快、更高效。3) 为了对标注器性能进行基准测试,我们引入了一个公开可用的专家标注测试集 MIMIC-500,包含来自 MIMIC 验证集的 500 个案例。我们的研究结果表明,CheX-GPT 不仅在标注准确性上优于现有模型,而且展现出卓越的效率、灵活性和可扩展性,这得到了我们引入的 MIMIC-500 数据集的稳健基准测试的支持。代码和模型可在 https://github.com/Soombit-ai/CheXGPT 获取。
关键词
引用
@article{arxiv.2401.11505,
title = {CheX-GPT: Harnessing Large Language Models for Enhanced Chest X-ray Report Labeling},
author = {Jawook Gu and Kihyun You and Han-Cheol Cho and Jiho Kim and Eun Kyoung Hong and Byungseok Roh},
journal= {arXiv preprint arXiv:2401.11505},
year = {2024}
}
备注
16 pages, 3 figures