中文

MEDEQUALQA:使用反事实推理评估大型语言模型中的偏见

计算与语言 2025-10-16 v1 人工智能 计算机与社会

摘要

大型语言模型(LLM)越来越多地部署于临床决策支持,然而微妙的人口统计学线索可能会影响其推理。先前的工作记录了不同患者群体输出结果的差异,但对于在受控的人口统计学变化下内部推理如何变化知之甚少。我们引入了MEDEQUALQA,一个反事实基准,它在保持关键症状和条件(CSC)不变的情况下,仅扰动患者代词(he/him, she/her, they/them)。每个临床小场景被扩展为单CSC消融,产生三个并行数据集,每个约23,000个项目(总共69,000个)。我们评估了一个GPT-4.1模型,并计算推理轨迹之间的语义文本相似度(STS)以衡量跨代词变体的稳定性。我们的结果显示总体相似度很高(平均STS > 0.80),但揭示了在引用的风险因素、指南依据和鉴别诊断排序中存在一致的局部差异,即使最终诊断保持不变。我们的错误分析突出了某些推理发生变化的案例,强调了可能级联导致不公平护理的临床相关偏见位点。MEDEQUALQA为审计医学AI中的推理稳定性提供了一个受控的诊断环境。

关键词

引用

@article{arxiv.2510.12818,
  title  = {MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning},
  author = {Rajarshi Ghosh and Abhay Gupta and Hudson McBride and Anurag Vaidya and Faisal Mahmood},
  journal= {arXiv preprint arXiv:2510.12818},
  year   = {2025}
}