中文

如何诊断和治疗大语言模型在临床决策中的偏见?

人工智能 2024-10-23 v1 机器学习

摘要

近期大语言模型(LLM)的快速发展使其成为临床决策的强大工具, healthcare 领域的应用不断拓展。然而,关于 bias 的担忧仍是 LLM 在临床实施中的重大挑战,尤其是关于性别和族裔的 bias。本研究探讨了应用于复杂临床病例的 LLM 的 bias 评估与缓解,聚焦于性别和族裔 bias。我们引入了一个源自 JAMA 临床挑战赛的 novel Counterfactual Patient Variations(CPV)数据集。使用该数据集,我们构建了一个用于 bias 评估的 framework,采用多选问答(MCQs)及其相应解释。我们探索了八种 LLM 的 prompting 与 fine-tuning 作为缓解 bias 的方法。我们的发现表明,解决 LLM 中的社会 bias 需要多维方法:缓解性别 bias 可能同时引入族裔 bias,而且 LLM 在不同医学专科的 embedding 中的性别 bias 差异很大。我们展示,评估 MCQ 响应与解释过程至关重要,因为正确的响应可能基于偏见的 reasoning。我们提供了一个用于评估真实临床案例中 LLM bias 的 framework,提供了关于这些模型中 bias 复杂性的见解,并提出了缓解 strategy。

关键词

引用

@article{arxiv.2410.16574,
  title  = {How Can We Diagnose and Treat Bias in Large Language Models for Clinical Decision-Making?},
  author = {Kenza Benkirane and Jackie Kay and Maria Perez-Ortiz},
  journal= {arXiv preprint arXiv:2410.16574},
  year   = {2024}
}