CLIMB:大型语言模型临床偏倚基准
计算与语言
2024-11-18 v2
摘要
大型语言模型(LLM)越来越多地被应用于临床决策。然而,它们表现出偏倚的潜力对临床公平性构成了重大风险。目前,缺乏系统评估 LLM 中此类临床偏倚的基准。虽然在下游任务中,LLM 的某些偏倚可以通过指示模型回答“我不确定...”等方式来避免,但隐藏在模型内部的偏倚仍缺乏深入研究。我们引入了 CLIMB(A Benchmark of Clinical Bias in Large Language Models 的简称),这是一个开创性的综合基准,用于评估 LLM 在临床决策任务中的内在偏倚(LLM 内部)和外在偏倚(下游任务)。值得注意的是,对于内在偏倚,我们引入了一种新颖的度量标准 AssocMAD,用于评估 LLM 在多个不同人口统计群体之间的差异。此外,我们利用反事实干预来评估临床诊断预测任务中的外在偏倚。我们在流行和医学适配的 LLM(特别是来自 Mistral 和 LLaMA 家族的模型)上的实验揭示了普遍存在的内在和外在偏倚行为。这项工作强调了减轻临床偏倚的关键需求,并为未来评估 LLM 临床偏倚设立了新标准。
引用
@article{arxiv.2407.05250,
title = {CLIMB: A Benchmark of Clinical Bias in Large Language Models},
author = {Yubo Zhang and Shudi Hou and Mingyu Derek Ma and Wei Wang and Muhao Chen and Jieyu Zhao},
journal= {arXiv preprint arXiv:2407.05250},
year = {2024}
}