中文

探索GPT-4在放射学中的能力边界

计算与语言 2023-10-24 v1

摘要

通用领域大语言模型(LLM)近期的成功显著改变了自然语言处理范式,朝向跨领域与应用的统一基础模型发展。本文中,我们着重评估迄今最强大的LLM——GPT-4,在放射学报告文本应用上的表现,并与最先进的(SOTA)放射学专用模型比较。通过探索多种提示策略,我们在多种常见放射学任务上评估了GPT-4,发现GPT-4优于或与当前SOTA放射学模型相当。采用零样本提示时,GPT-4在时间句相似度分类(准确率)和自然语言推理(F1F_1)上已相较放射学模型获得显著提升(约10%绝对提升)。对于需学习数据集特定风格或模式(如发现小结)的任务,GPT-4通过基于示例的提示得到改进,并匹敌有监督SOTA。我们与一名获委员会认证的放射科医师开展的广泛错误分析显示,GPT-4具备充足的放射学知识水平,仅在需细致领域知识的复杂语境中偶发错误。对于发现小结,GPT-4输出总体与现有人工撰写的印象相当。

关键词

引用

@article{arxiv.2310.14573,
  title  = {Exploring the Boundaries of GPT-4 in Radiology},
  author = {Qianchu Liu and Stephanie Hyland and Shruthi Bannur and Kenza Bouzid and Daniel C. Castro and Maria Teodora Wetscherek and Robert Tinn and Harshita Sharma and Fernando Pérez-García and Anton Schwaighofer and Pranav Rajpurkar and Sameer Tajdin Khanna and Hoifung Poon and Naoto Usuyama and Anja Thieme and Aditya V. Nori and Matthew P. Lungren and Ozan Oktay and Javier Alvarez-Valle},
  journal= {arXiv preprint arXiv:2310.14573},
  year   = {2023}
}

备注

EMNLP 2023 main