中文

大型语言模型在临床应用中的偏见:系统性综述

计算与语言 2025-04-07 v1 人工智能

摘要

背景:大型语言模型(LLM)正快速被整合到医疗保健领域,旨在增强各种临床任务。然而,关于其潜在偏见的担忧存在,可能损害患者护理并加剧健康不平等。本系统性综述调查了 LLM 中偏见的流行程度、来源、表现形式及临床影响。方法:我们从数据库创立之日起至2025年在 PubMed、OVID 和 EMBASE 中进行系统检索,筛选评估临床任务中 LLM 偏见的研究。提取了关于 LLM 类型、偏见来源、偏见表现、受影响属性、临床任务、评估方法以及结果的数据。采用修改版 ROBINS-I 工具评估偏风险。结果:符合纳入标准的38项研究揭示了各种 LLM 和临床应用中普遍存在的偏见。来自有偏见训练数据的偏见(数据相关偏见)和来自模型训练的偏见(模型相关偏见)都是重要贡献者。偏见表现为:分配性伤害(例如,差异化治疗建议);表征性伤害(例如,刻板印�关联、偏见图像生成);以及绩效差异(例如,输出质量差异)。这些偏见影响了多个属性,最常涉及种族/民族和性别,但也包括年龄、残障和语言。结论:临床 LLM 中的偏见是一种普遍且系统性的问题,可能导致误诊和不当治疗,尤其是针对被边缘化的患者群体。对模型进行严格的评估至关重要。此外,开发和实施有效的缓解策略,以及在实际临床环境中持续监控,都是确保 LLM 在医疗保健领域安全、公平且可信部署的关键。

关键词

引用

@article{arxiv.2504.02917,
  title  = {Bias in Large Language Models Across Clinical Applications: A Systematic Review},
  author = {Thanathip Suenghataiphorn and Narisara Tribuddharat and Pojsakorn Danpanichkul and Narathorn Kulthamrongsri},
  journal= {arXiv preprint arXiv:2504.02917},
  year   = {2025}
}