中文

HealthQA-BR:一个系统级基准揭示大型语言模型中的关键知识缺口

计算与语言 2025-06-30 v1 人工智能

摘要

大型语言模型(LLM)在医疗保健领域的评估一直由以医生为中心、英语语言的基准所主导,这造成了一种危险的胜任能力假象,忽视了患者护理的跨专业性质。为了提供更全面和现实的评估,我们引入了HealthQA-BR,这是首个面向葡萄牙语医疗保健领域的大规模、系统级基准。该基准包含来自巴西国家执业和住院医师考试的5,632个问题,其独特之处在于不仅评估医学及其专科的知识,还评估护理、牙科、心理学、社会工作和其他相关健康专业的知识。我们对超过20个领先的LLM进行了严格的零样本评估。我们的结果显示,虽然像GPT 4.1这样的最先进模型达到了较高的总体准确率(86.6%),但这个最高分数掩盖了令人担忧的、先前未测量到的缺陷。细粒度分析显示,性能从眼科等专科的近乎完美(98.7%)骤降至神经外科的勉强及格(60.0%),最值得注意的是,在社会工作领域仅为68.4%。这种“尖刺状”的知识轮廓是所有模型中都观察到的系统性问题,表明高分不足以进行安全验证。通过公开发布HealthQA-BR和我们的评估套件,我们提供了一个关键工具,以超越单一分数评估,转向对整个医疗团队AI准备度进行更诚实、更细粒度的审计。

关键词

引用

@article{arxiv.2506.21578,
  title  = {HealthQA-BR: A System-Wide Benchmark Reveals Critical Knowledge Gaps in Large Language Models},
  author = {Andrew Maranhão Ventura D'addario},
  journal= {arXiv preprint arXiv:2506.21578},
  year   = {2025}
}