开源模型是否已就绪?商业与开源大语言模型在胸部 X 光报告标注能力上的比较研究
计算与语言
2024-11-15 v1 人工智能
摘要
引言:随着大语言模型 (LLM) 的快速发展,出现了众多新的开源及商业模型。虽然最近的出版物探讨了 GPT-4 在从放射学报告中提取感兴趣信息方面的应用,但尚未有将 GPT-4 与不同领先开源模型进行的现实世界比较。材料与方法:使用了两个不同且独立的数据集。第一个数据集包含 2019 年 7 月至 2021 年 7 月在麻省总医院创建的 540 份胸部 X 光报告。第二个数据集包含来自 ImaGenome 数据集的 500 份胸部 X 光报告。随后,我们比较了 OpenAI 的商业模型 GPT-3.5 Turbo 和 GPT-4 与开源模型 Mistral-7B、Mixtral-8x7B、Llama2-13B、Llama2-70B、QWEN1.5-72B 以及 CheXbert 和 CheXpert-labeler 在使用不同提示技术准确标注 X 光文本报告中多种发现存在与否的能力。结果:在 ImaGenome 数据集上,表现最佳的开源模型是 Llama2-70B,其零样本和少样本提示的微 F1 分数分别为 0.972 和 0.970。GPT-4 的微 F1 分数分别为 0.975 和 0.984。在机构数据集上,表现最佳的开源模型是 QWEN1.5-72B,其零样本和少样本提示的微 F1 分数分别为 0.952 和 0.965。GPT-4 的微 F1 分数分别为 0.975 和 0.973。结论:本文表明,虽然 GPT-4 在零样本报告标注方面优于开源模型,但实施少样本提示可使开源模型达到与 GPT-4 相当的水平。这表明开源模型可成为放射学报告分类任务中一种高性能且保护隐私的 GPT-4 替代方案。
引用
@article{arxiv.2402.12298,
title = {Is Open-Source There Yet? A Comparative Study on Commercial and Open-Source LLMs in Their Ability to Label Chest X-Ray Reports},
author = {Felix J. Dorfner and Liv Jürgensen and Leonhard Donle and Fares Al Mohamad and Tobias R. Bodenmann and Mason C. Cleveland and Felix Busch and Lisa C. Adams and James Sato and Thomas Schultz and Albert E. Kim and Jameson Merkow and Keno K. Bressem and Christopher P. Bridge},
journal= {arXiv preprint arXiv:2402.12298},
year = {2024}
}