大语言模型在医疗领域的性别偏见:分配一致性与临床影响
计算与语言
2025-10-13 v1
摘要
将大语言模型(LLM)集成到医疗领域有望提升临床决策,但其对偏见的敏感性仍是关键关切。性别长期影响医生行为和患者结局,使我们担忧承担类人角色(如临床医生或医学教育者)的 LLM 可能复制或放大性别相关偏见。我们采用《《新英格兰医学杂志挑战赛》(NEJM)中的案例研究,将性别(女性、男性或未指定)分配给多个开源和商业 LLM。我们评估了其在 LLM-性别分配下的响应一致性,涵盖 LLM 诊断以及模型对患者性别临床相关性或必要性的判断。在我们的发现中,诊断结果在大多数模型下对 LLM 性别分配保持相对一致。然而,在患者性别的相关性和必要性方面的判断上,所有模型在 LLM 性别分配下表现出显著不一致,尤其在相关性判断方面。一些模型甚至显示出系统性的女性-男性差异。这些发现揭示了一种尚未充分被探讨的偏见,可能削弱 LLM 在临床实践中的可靠性,强调在与 LLM 交互时进行身份分配一致性常规检查的必要性,以确保可靠且公平的 AI 支持临床护理。
引用
@article{arxiv.2510.08614,
title = {Gender Bias in Large Language Models for Healthcare: Assignment Consistency and Clinical Implications},
author = {Mingxuan Liu and Yuhe Ke and Wentao Zhu and Mayli Mertens and Yilin Ning and Jingchi Liao and Chuan Hong and Daniel Shu Wei Ting and Yifan Peng and Danielle S. Bitterman and Marcus Eng Hock Ong and Nan Liu},
journal= {arXiv preprint arXiv:2510.08614},
year = {2025}
}