中文

FairMedQA:医疗问答大语言模型中的偏见基准测试

人工智能 2026-01-13 v2

摘要

大语言模型(LLMs)在医疗问答(QA)方面正接近专家级表现,展现出改善公共医疗的巨大潜力。然而,与性别和种族等敏感属性相关的潜在偏见带来了危及生命的风险。这些敏感属性在多大程度上影响诊断仍是一个悬而未决的问题,需要全面的实证调查。此外,即使是最新提出的反事实患者变体(CPV)基准也难以区分不同 LLM 的偏见水平。为了进一步探索这些动态变化,我们提出了一个新基准 FairMedQA,并对 12 个具有代表性的 LLM 进行了基准测试。FairMedQA 包含 4,806 对由 801 个临床小样本构建的反事实问题对。我们的结果显示,在不同敏感人口群体中,准确率存在 3 到 19 个百分点的显著差异。值得注意的是,FairMedQA 揭示的偏见比最新 CPV 基准识别出的偏见至少大 12 个百分点,展现出更优的基准测试敏感性。我们的结果强调,在将 LLM 安全整合到实际临床决策支持系统之前,迫切需要针对性的去偏技术和更严格的身份感知验证协议。

关键词

引用

@article{arxiv.2505.19562,
  title  = {FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering},
  author = {Ying Xiao and Jie Huang and Ruijuan He and Jing Xiao and Mohammad Reza Mousavi and Yepang Liu and Kezhi Li and Zhenpeng Chen and Jie M. Zhang},
  journal= {arXiv preprint arXiv:2505.19562},
  year   = {2026}
}