ChatGPT 系列模型在生物医学推理与分类中的评估
计算与语言
2024-03-29 v1 人工智能
摘要
大语言模型(LLMs)的近期进展在生物医学问答中展现出令人印象深刻的能力,但在更具体的生物医学应用中尚未得到充分研究。本研究探讨了诸如 ChatGPT 系列模型(GPT-3.5s、GPT-4)等 LLMs 在问答之外的生物医学任务中的表现。由于无法将患者数据传至 OpenAI API 公共接口,我们使用超过 10000 个样本作为代理,评估了模型在临床领域两项基本任务——分类与推理——上的性能。第一项任务是分类科学文献中的临床与政策推荐陈述是否构成健康建议。第二项任务是从生物医学文献中检测因果关系。我们将 LLMs 与较简单的模型(如带逻辑回归的词袋模型(BoW)和微调的 BioBERT 模型)进行了比较。尽管围绕病毒式传播的 ChatGPT 热情高涨,我们发现针对两项基本 NLP 任务的微调仍是最佳策略。简单的 BoW 模型表现与最复杂的 LLM 提示相当。提示工程需要大量投入。
引用
@article{arxiv.2304.02496,
title = {Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification},
author = {Shan Chen and Yingya Li and Sheng Lu and Hoang Van and Hugo JWL Aerts and Guergana K. Savova and Danielle S. Bitterman},
journal= {arXiv preprint arXiv:2304.02496},
year = {2024}
}
备注
28 pages, 2 tables and 4 figures. Submitting for review