中文

逆命题文化暗示降低医学问答准确率:标识符 vs 语境效应

计算与语言 2026-01-29 v1

摘要

工程可持续且公平的医疗保健需要医学语言模型在呈现非决定性文化信息时仍能保持临床正确诊断的稳定性。我们引入了一个逆命题基准,将150个 MedQA 测试项目扩展为1650个变体,通过插入与三个群体(Indigenous Canadian、Middle-Eastern Muslim、Southeast Asian)相关的 (i) 标识符记号、(ii) 语境暗示,或 (iii) 两者的组合,外加长度匹配的中性对照,其中临床专家验证所有变体的 gold 答案均保持不变。我们评估 GPT-5.2、Llama-3.1-8B、DeepSeek-R1 和 MedGemma(4B/27B)在仅选项和简要解释提示下的表现。在所有模型中,文化暗示显著影响准确率(Cochran's Q, p<10^-14),在标识符与语境同时出现时 degradation 最大(仅选项提示下下降最高3-7个百分点),而中性编辑产生较小且不系统的变化。一个经人类验证的评分标准(κ=0.76)通过 LLM 作为评判器应用显示,超过半数的文化关联解释最终导致错误答案,将文化相关推理与诊断失败联系起来。我们发布提示词和增强内容,以支持评估和缓解由文化引起的诊断误差。

关键词

引用

@article{arxiv.2601.20102,
  title  = {Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects},
  author = {Amirhossein Haji Mohammad Rezaei and Zahra Shakeri},
  journal= {arXiv preprint arXiv:2601.20102},
  year   = {2026}
}