LLM应用于临床决策支持中的偏见模式:一项综合研究
计算与语言
2024-04-24 v1 机器学习
摘要
大型语言模型(LLM)已成为为临床决策过程提供信息的强大候选者。虽然这些模型在塑造数字景观方面发挥着越来越重要的作用,但在医疗应用中出现了两个日益增长的担忧:1)LLM在多大程度上基于患者受保护属性(如种族)表现出社会偏见,以及2)设计选择(如架构设计和提示策略)如何影响观察到的偏见?为了严格回答这些问题,我们使用标准化偏见评估的临床小插图(患者描述)评估了八个流行的LLM在三个问答(QA)数据集上的表现。我们采用红队策略分析人口统计学如何影响LLM输出,比较通用模型和临床训练模型。我们广泛的实验揭示了受保护群体之间的各种差异(有些显著)。我们还观察到一些反直觉的模式,例如较大的模型不一定偏见更少,在医学数据上微调的模型不一定比通用模型更好。此外,我们的研究证明了提示设计对偏见模式的影响,并表明特定措辞可以影响偏见模式,而反思型方法(如思维链)可以有效减少偏见结果。与先前研究一致,我们呼吁对用于临床决策支持的LLM进行额外的评估、审查和改进。
引用
@article{arxiv.2404.15149,
title = {Bias patterns in the application of LLMs for clinical decision support: A comprehensive study},
author = {Raphael Poulain and Hamed Fayyaz and Rahmatollah Beheshti},
journal= {arXiv preprint arXiv:2404.15149},
year = {2024}
}