mFARM:基于临床决策支持中HARMs的多维度公平性评估
人工智能
2025-09-03 v1
摘要
在高风险医疗环境中部署大型语言模型(LLM)带来了关键的AI对齐挑战,因为模型可能继承并放大社会偏见,导致显著的不平等。现有的公平性评估方法在这些场景下存在不足,因为它们通常使用过于简单的指标,忽略了医疗危害的多维性质。这也促使模型仅仅因为临床惰性而显得公平,默认输出安全但可能不准确的结果。为了解决这一差距,我们的贡献主要有两方面:首先,我们从MIMIC-IV构建了两个大规模、受控基准(ED-Triage和Opioid Analgesic Recommendation),包含超过50,000个提示,具有十二种种族×性别变体和三个上下文层级。其次,我们提出了一个多指标框架——基于HARMs的多维度公平性评估(),以审计三个不同差异维度(分配性、稳定性和潜在性)的公平性,并将它们聚合为分数。我们还提出了一个聚合的公平性-准确性平衡(FAB)分数,以进行基准测试并观察公平性与预测准确性之间的权衡。我们在量化和上下文变化下实证评估了四个开源LLM(Mistral-7B、BioMistral-7B、Qwen-2.5-7B、Bio-LLaMA3-8B)及其微调版本。我们的研究结果表明,所提出的指标在各种设置下能更有效地捕捉细微偏见。我们发现,大多数模型在不同量化级别下以分数衡量均保持稳健性能,但在上下文减少时性能显著下降。我们公开发布了基准和评估代码,以促进面向医疗保健的对齐AI研究。
引用
@article{arxiv.2509.02007,
title = {mFARM: Towards Multi-Faceted Fairness Assessment based on HARMs in Clinical Decision Support},
author = {Shreyash Adappanavar and Krithi Shailya and Gokul S Krishnan and Sriraam Natarajan and Balaraman Ravindran},
journal= {arXiv preprint arXiv:2509.02007},
year = {2025}
}