GPT 能否重新定义医学理解?在生物医学机器阅读理解中的评估
计算与语言
2024-10-28 v2 人工智能
机器学习
摘要
大语言模型 (LLM) 在不同领域的众多任务上显示出惊人的性能。然而,其在封闭式生物医学机器阅读理解 (MRC) 任务中的表现尚未深入评估。本文在四个封闭式生物医学 MRC 基准测试中评估 GPT。我们实验不同的常规提示技术,同时引入我们自研的新型提示方法。为解决 LLM 本身固有的检索问题,我们提出一种称为隐式检索增强生成 (RAG) 的提示策略,该策略减轻了传统 RAG 设置中使用向量数据库检索重要文本块的需求。此外,我们对我们方法生成的自然语言输出进行定性评估。结果表明,我们的新型提示技术在两个数据集上取得最佳性能,其余两个数据集中排名第二。实验表明,现代 LLM 如 GPT 即便在零样本设置下也能超越监督模型,在两个基准测试中实现新的最高结果 (SOTA)。
关键词
引用
@article{arxiv.2405.18682,
title = {Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension},
author = {Shubham Vatsal and Ayush Singh},
journal= {arXiv preprint arXiv:2405.18682},
year = {2024}
}