BPQA数据集:评估语言模型如何利用血压回答生物医学问题
计算与语言
2025-03-07 v1
摘要
临床测量如血压和呼吸频率在诊断和监测患者结局中至关重要。它们是生物医学数据的重要组成部分,可用于训练基于变换器的语言模型(LMs)以改善医疗交付。然而,尚不清楚LMs能否有效解释和使用临床测量。我们研究了两个问题:第一,LMs能否有效利用临床测量来回答相关医学问题?第二,如何提升LM在涉及测量的医学问答(QA)任务上的性能?我们以血压读数(BPs)作为案例研究,这是一种由医疗专业人员常规监测的生命体征。我们在新建的BPQA(血压问答)数据集上评估了四种LMs的性能:BERT、BioBERT、MedAlpaca和GPT-3.5。BPQA包含100个由医学生验证的医学QA对,设计上依赖于血压数据。我们发现GPT-3.5和MedAlpaca(较大和中等规模的LMs)比BERT和BioBERT(较小规模的LMs)更能从血压的纳入中受益。此外,通过标签增强测量可以改善BioBERT和MedAlpaca(领域特定LMs)的性能,这表明检索可能对提升领域特定LMs有用。
引用
@article{arxiv.2503.04155,
title = {BPQA Dataset: Evaluating How Well Language Models Leverage Blood Pressures to Answer Biomedical Questions},
author = {Chi Hang and Ruiqi Deng and Lavender Yao Jiang and Zihao Yang and Anton Alyakin and Daniel Alber and Eric Karl Oermann},
journal= {arXiv preprint arXiv:2503.04155},
year = {2025}
}
备注
9 pages