中文

大型语言模型不适用于生物医学信息抽取的零样图式推理

计算与语言 2025-05-20 v2 人工智能 机器学习

摘要

大型语言模型(LLM)在医疗保健领域的应用日益增长,已在问答和文档概述等任务上达到专业水平。尽管在这些任务中取得了成功,但 LLM 在传统上由生物医学领域 pursued 的任务(如结构化信息抽取)的表现如何尚不明了。为填补这一差距,本文系统性地对 LLM 在医学分类和命名实体识别(NER)任务中的性能进行基准测试。我们的目标是分解不同因素对性能的贡献,特别是 LLM 任务知识与推理能力、其(参数)领域知识,以及外部知识的添加。为此,我们评估了各种开源 LLM——包括 BioMistral 和 Llama-2 模型——在多样化的生物医学数据集上,使用标准提示、链式思考(CoT)和自我一致性基于推理以及使用 PubMed 和 Wikipedia 语料库的检索增强生成(RAG)。出乎意料的是,我们的结果显示,标准提示在两项任务中始终优于更复杂的技术,直观地揭示了当前在生物医学领域应用 CoT、自我一致性和 RAG 的局限性。我们的发现表明,针对知识或推理密集型任务(如 CoT 或 RAG)开发的高级提示方法在需要精确结构化输出的生物医学任务中难以移植。这凸显了需要在 LLM 中更有效地集成外部知识和推理机制,以提升其在现实生物医学应用中的性能的需求。

关键词

引用

@article{arxiv.2408.12249,
  title  = {LLMs are not Zero-Shot Reasoners for Biomedical Information Extraction},
  author = {Aishik Nagar and Viktor Schlegel and Thanh-Tung Nguyen and Hao Li and Yuping Wu and Kuluhan Binici and Stefan Winkler},
  journal= {arXiv preprint arXiv:2408.12249},
  year   = {2025}
}

备注

15 pages