DiversityMedQA:评估大型语言模型在医学诊断中的人口统计偏见
计算与语言
2024-12-09 v2
摘要
随着大型语言模型 (LLM) 在医疗领域的应用日益广泛,关于其对人口统计偏见敏感性的关注也在增长。我们引入 DiversityMedQA,这是一个新型基准,旨在评估 LLM 对医学查询在不同患者人口统计特征(如性别和种族)下的响应。通过扰动来自 MedQA 数据集的提问(该数据集包含医学执照考试问题),我们创建了一个捕捉医学诊断在不同患者档案中细微差异的基准。我们的发现显示,在这些人口统计特征变化下,模型表现存在显著差异。此外,为确保扰动的准确性,我们还提出了一种过滤策略,用于验证每一次扰动。通过发布 DiversityMedQA,我们为评估和缓解 LLM 医疗诊断中的人口统计偏见提供了资源。
引用
@article{arxiv.2409.01497,
title = {DiversityMedQA: Assessing Demographic Biases in Medical Diagnosis using Large Language Models},
author = {Rajat Rawat and Hudson McBride and Dhiyaan Nirmal and Rajarshi Ghosh and Jong Moon and Dhruv Alamuri and Sean O'Brien and Kevin Zhu},
journal= {arXiv preprint arXiv:2409.01497},
year = {2024}
}
备注
Published in NLP4PI @ EMNLP 2024, Accepted to AIM-FM @ NeurIPS 2024