中文

从有前景的能力到普遍偏见:评估大型语言模型在急诊室分诊中的表现

人工智能 2025-08-06 v2 人机交互

摘要

大型语言模型 (LLM) 在临床决策支持方面显示出前景,但其在分诊中的应用仍未得到充分探索。我们系统性地调查了 LLM 在急诊室分诊中的能力,通过两个关键维度:(1) 对分布偏移和缺失数据的鲁棒性,(2) 跨性别和种族的反事实分析中的交叉偏见。我们评估了多种 LLM 方法,从继续预训练到情境学习,以及机器学习方法。我们的结果表明,LLM 在鲁棒性方面表现优于其他方法,我们进一步探讨了导致这些有前景方法的关键因素。此外,在这种情况下,我们识别出 LLM 偏好在特定性别和种族交叉点中出现的差距。LLM 通常表现出性别差异,但在某些种族群体中最为显著。这些发现表明 LLM 编码了在特定临床情境或特定特征组合中出现的人口统计学偏好。

关键词

引用

@article{arxiv.2504.16273,
  title  = {From Promising Capability to Pervasive Bias: Assessing Large Language Models for Emergency Department Triage},
  author = {Joseph Lee and Tianqi Shang and Jae Young Baik and Duy Duong-Tran and Shu Yang and Lingyao Li and Li Shen},
  journal= {arXiv preprint arXiv:2504.16273},
  year   = {2025}
}

备注

Presented at GenAI4Health Workshop @ AAAI 2025 (non-archival), Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing 2026