中文

面向生物医学自然语言处理应用的大语言模型基准测试与建议

计算与语言 2025-04-29 v5 人工智能 信息检索 机器学习

摘要

生物医学文献的快速增长给人工知识整理与综合带来挑战。生物医学自然语言处理 (BioNLP) 使该过程自动化。尽管大语言模型 (LLM) 在通用领域已展现出潜力,但由于基准测试和实用指南有限,它们在 BioNLP 任务中的有效性仍不明确。我们对四种 LLM(GPT 和 LLaMA 的代表)在跨越六种应用的 12 个 BioNLP 基准上进行了系统评估。我们将它们的零样本、少样本和微调性能与 BERT 或 BART 模型的传统微调进行比较。我们考察了不一致性、信息缺失、幻觉,并进行了成本分析。本文表明,传统微调在大多数任务中优于零样本或少样本 LLM。然而,像 GPT-4 这样的闭源 LLM 在医学问答等推理相关任务中表现出色。开源 LLM 仍需微调以缩小性能差距。我们发现了 LLM 输出中信息缺失和幻觉等问题。这些结果为在 BioNLP 中应用 LLM 提供了实用见解。

关键词

引用

@article{arxiv.2305.16326,
  title  = {Benchmarking large language models for biomedical natural language processing applications and recommendations},
  author = {Qingyu Chen and Yan Hu and Xueqing Peng and Qianqian Xie and Qiao Jin and Aidan Gilson and Maxwell B. Singer and Xuguang Ai and Po-Ting Lai and Zhizheng Wang and Vipina Kuttichi Keloth and Kalpana Raja and Jiming Huang and Huan He and Fongci Lin and Jingcheng Du and Rui Zhang and W. Jim Zheng and Ron A. Adelman and Zhiyong Lu and Hua Xu},
  journal= {arXiv preprint arXiv:2305.16326},
  year   = {2025}
}