中文

大型语言模型对医疗专业人士偏好的评估

计算机与社会 2024-07-18 v1 人工智能

摘要

本研究评估大型语言模型(LLM)是否存在对医疗专业人士的偏见。创建了虚构的候选人简历,以控制身份因素的同时保持一致的资格。对三个 LLM(GPT-4、Claude-3-haiku 和 Mistral-Large)进行了标准化测试,以评估特定住院医师项目的简历。通过更改性别和种族信息测试显性偏见,而通过更改姓名(隐藏种族和性别)测试隐性偏见。使用来自美国医学院(Association of American Medical Colleges)的医生数据与实际人口统计进行比较。评估了 90 万份简历。所有 LLM 在医疗专业领域均显示出显著的性别和种族偏见。性别偏好因医学 specialty 而异:手术和骨科偏好男性候选人,而皮肤科、家庭医学、产科和妇科、儿科和精神科偏好女性候选人。Claude-3 和 Mistral-Large generally 偏好亚裔候选人,而 GPT-4 在多个 specialty 中偏好黑裔和西班牙裔候选人。测试结果显示,在 various specialty 中对 Hispanic 女性和亚裔男性存在强烈偏好。与实际数据相比,LLM 持续选择了更高比例的女性和少数族裔候选人,超出其在医疗劳动力中实际的比例。GPT-4、Claude-3 和 Mistral-Large 在评估医疗专业人士进行住院医师选择时表现出显著的性别和种族偏见。这些发现凸显了若未采取适当偏见缓解措施,LLM 可能延续偏见并损害医疗劳动力多样性的潜力。

关键词

引用

@article{arxiv.2407.12031,
  title  = {Evaluation of Bias Towards Medical Professionals in Large Language Models},
  author = {Xi Chen and Yang Xu and MingKe You and Li Wang and WeiZhi Liu and Jian Li},
  journal= {arXiv preprint arXiv:2407.12031},
  year   = {2024}
}

备注

36 pages, 6 figures