Fairboard:医疗模型公平性评估的定量框架
机器学习
2026-04-14 v1 人工智能
应用统计
统计方法学
摘要
尽管如今已有超过 1000 项 FDA 批准的 AI 医疗器械,但对于模型性能在患者子组间是否均匀的正式公平性评估却鲜有涉及。本文我们评估了 18 项开源脑肿瘤分割模型在 648 名ergoma患者(共计 11,664 次模型推断)中的公平性,沿着独立的、贝叶斯的多变量、空间和表征维度进行分析。我们发现患者身份始终解释的性能方差比模型选择更大,临床因素(包括分子诊断、肿瘤分级和切除范围)对分割精度的预测能力强于模型架构。基于体素的空间元分析识别出局部于神经解剖结构的偏见,这些偏见是器官分布特有的,但在不同模型之间往往是一致的。在肿瘤掩模和临床人口学特征的高维潜在空间中,模型性能聚类显著,表明患者特征空间包含算法脆弱性的轴向。虽然较新的模型倾向于更好的公平性,但没有模型提供正式的公平保证。最后,我们发布了Fairboard——一个开源的、无需编程的仪表盘,降低了医学影像中公平模型监控的门槛。
引用
@article{arxiv.2604.09656,
title = {Fairboard: a quantitative framework for equity assessment of healthcare models},
author = {James K. Ruffle and Samia Mohinta and Chris Foulon and Mohamad Zeina and Zicheng Wang and Sebastian Brandner and Harpreet Hyare and Parashkev Nachev},
journal= {arXiv preprint arXiv:2604.09656},
year = {2026}
}
备注
30 pages, 6 figures, 109 extended data figures (ancillary file)