中文

GPT 能否重新定义医学理解?在生物医学机器阅读理解中的评估

计算与语言 2024-10-28 v2 人工智能 机器学习

摘要

大语言模型 (LLM) 在不同领域的众多任务上显示出惊人的性能。然而,其在封闭式生物医学机器阅读理解 (MRC) 任务中的表现尚未深入评估。本文在四个封闭式生物医学 MRC 基准测试中评估 GPT。我们实验不同的常规提示技术,同时引入我们自研的新型提示方法。为解决 LLM 本身固有的检索问题,我们提出一种称为隐式检索增强生成 (RAG) 的提示策略,该策略减轻了传统 RAG 设置中使用向量数据库检索重要文本块的需求。此外,我们对我们方法生成的自然语言输出进行定性评估。结果表明,我们的新型提示技术在两个数据集上取得最佳性能,其余两个数据集中排名第二。实验表明,现代 LLM 如 GPT 即便在零样本设置下也能超越监督模型,在两个基准测试中实现新的最高结果 (SOTA)。

关键词

引用

@article{arxiv.2405.18682,
  title  = {Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension},
  author = {Shubham Vatsal and Ayush Singh},
  journal= {arXiv preprint arXiv:2405.18682},
  year   = {2024}
}