中文

CheX-GPT:利用大语言模型增强胸部 X 光报告标注

计算与语言 2024-11-07 v2 信息检索

摘要

自由文本放射学报告为各种医疗任务提供了丰富的数据源,但有效地对这些文本进行标注仍然具有挑战性。传统的基于规则的标注方法无法捕捉多样自由文本模式的细微差别。此外,使用专家标注数据的模型受到数据稀缺和预定义类别的限制,影响了其性能、灵活性和可扩展性。为了解决这些问题,我们的研究提供了三个主要贡献:1) 我们展示了使用精心设计的提示时 GPT 作为熟练标注器的潜力。2) 仅使用 GPT 标注的数据,我们训练了一个基于 BERT 的标注器 CheX-GPT,其运行速度比 GPT 对应模型更快、更高效。3) 为了对标注器性能进行基准测试,我们引入了一个公开可用的专家标注测试集 MIMIC-500,包含来自 MIMIC 验证集的 500 个案例。我们的研究结果表明,CheX-GPT 不仅在标注准确性上优于现有模型,而且展现出卓越的效率、灵活性和可扩展性,这得到了我们引入的 MIMIC-500 数据集的稳健基准测试的支持。代码和模型可在 https://github.com/Soombit-ai/CheXGPT 获取。

关键词

引用

@article{arxiv.2401.11505,
  title  = {CheX-GPT: Harnessing Large Language Models for Enhanced Chest X-ray Report Labeling},
  author = {Jawook Gu and Kihyun You and Han-Cheol Cho and Jiho Kim and Eun Kyoung Hong and Byungseok Roh},
  journal= {arXiv preprint arXiv:2401.11505},
  year   = {2024}
}

备注

16 pages, 3 figures