中文

生物医学 NLP 中的检索增强型大语言模型基准测试:应用、鲁棒性与自我意识

计算与语言 2025-11-17 v3

摘要

大型语言模型(LLM)在 various 生物医学自然语言处理(NLP)任务中展现出惊人的能力,利用输入上下文中的演示来适应新任务。然而,LLM 对演示选择敏感。为解决 LLM 固有的幻觉问题,检索增强型 LLM(RAL)通过从 established 数据库中检索相关信息提供了解决方案。然而,现有研究缺乏对检索增强型大语言模型在不同生物医学 NLP 任务上的影响进行严格评估。这使得难以确定 RAL 在生物医学领域的能力。此外,RAL 的输出受到来自检索的 unlabeled、counterfactual 或多样化知识的影响,这些知识在生物医学领域中尚未得到充分研究。然而,这些知识在现实世界中很常见。最后,探索 RAL 系统的自我意识能力也至关重要。因此,本文我们系统性地研究了 RALs 对 5 个不同生物医学任务(三元组抽取、链接预测、分类、问答和自然语言推理)的影响。我们分析了 RALs 在四个基本能力方面的性能,包括 unlabeled 鲁棒性、counterfactual 鲁棒性、diverse 鲁棒性和 negative awareness。为此,我们提出了一个评估 RALs 在不同生物医学 NLP 任务上性能的评估框架,并建立了四个不同的 testbed 基于上述基本能力。然后,我们在 5 个任务上评估了 3 个代表性 LLMs 与 3 个不同的检索器。

关键词

引用

@article{arxiv.2405.08151,
  title  = {Benchmarking Retrieval-Augmented Large Language Models in Biomedical NLP: Application, Robustness, and Self-Awareness},
  author = {Mingchen Li and Zaifu Zhan and Han Yang and Yongkang Xiao and Jiatan Huang and Rui Zhang},
  journal= {arXiv preprint arXiv:2405.08151},
  year   = {2025}
}