BioPulse-QA:用于评估大型语言模型事实性、鲁棒性和偏见的动态生物医学问答基准
计算与语言
2026-01-21 v1 信息检索
摘要
目的:大型语言模型(LLM)越来越多地应用于生物医学领域,现有的基准数据集在支持模型开发和评估方面发挥了重要作用。然而,这些基准通常存在局限性。许多依赖静态或过时的数据集,无法捕捉生物医学知识的动态性、上下文丰富性和高风险性。它们还因与模型预训练语料库重叠而面临日益增加的数据泄露风险,并且常常忽视诸如对语言变异的鲁棒性和潜在人口统计学偏见等关键维度。材料与方法:为解决这些不足,我们引入了BioPulse-QA,一个评估LLM回答新发表生物医学文献(包括药品标签、试验方案和临床指南)问题的基准。BioPulse-QA包含2,280个专家验证的问答(QA)对及其扰动变体,涵盖抽取式和生成式格式。我们评估了四个LLM——GPT-4o、GPT-o1、Gemini-2.0-Flash和LLaMA-3.1 8B Instruct——这些模型均发布于基准文档发表日期之前。结果:GPT-o1在药品标签上取得了最高的宽松F1分数(0.92),其次是Gemini-2.0-Flash(0.90)。临床试验是最具挑战性的来源,抽取式F1分数低至0.36。讨论与结论:性能差异在改写方面大于拼写错误方面,而偏见测试显示差异可忽略不计。BioPulse-QA为评估生物医学LLM提供了一个可扩展且临床相关的框架。
引用
@article{arxiv.2601.12632,
title = {BioPulse-QA: A Dynamic Biomedical Question-Answering Benchmark for Evaluating Factuality, Robustness, and Bias in Large Language Models},
author = {Kriti Bhattarai and Vipina K. Keloth and Donald Wright and Andrew Loza and Yang Ren and Hua Xu},
journal= {arXiv preprint arXiv:2601.12632},
year = {2026}
}