中文

构建临床 LLM 的信任:偏差分析与数据集透明度

计算与语言 2025-10-22 v1

摘要

大型语言模型为医疗保健提供了变革性潜力,但其负责任且公平的开发依赖于深入理解训练数据特征如何影响模型行为,包括潜在的偏差问题。当前的数据集策划和偏差评估实践往往缺乏必要的透明度,导致急迫需要综合评估框架来培育信任并指导改进。在本研究中,我们对临床语言模型潜在的下游偏差进行了深入分析,重点关注不同人口统计学群体(如种族、性别和年龄)在阿片类处方倾向上的差异。作为本调查的一部分,我们引入了 HC4:Healthcare Comprehensive Commons Corpus,一套新型且经过严格策划的预训练数据集,规模超过 890 亿 token。我们的评估利用了既定的通用基准以及一种新颖的医疗专用方法,为临床 AI 应用的公平性和安全性提供了至关重要的见解。

关键词

引用

@article{arxiv.2510.18556,
  title  = {Building Trust in Clinical LLMs: Bias Analysis and Dataset Transparency},
  author = {Svetlana Maslenkova and Clement Christophe and Marco AF Pimentel and Tathagata Raha and Muhammad Umar Salman and Ahmed Al Mahrooqi and Avani Gupta and Shadab Khan and Ronnie Rajan and Praveenkumar Kanithi},
  journal= {arXiv preprint arXiv:2510.18556},
  year   = {2025}
}

备注

Accepted to EMNLP Main 2025