中文

机器学习临床支持系统中模型性能与稳定性的差异问题

机器学习 2025-03-04 v2 人工智能

摘要

机器学习 (ML) 算法是 biomedical informatics 中支持临床决策的关键工具。然而,其预测性能可能因训练数据集中历史上被边缘化人群的欠represention 而在不同人口统计族群间产生差异。调查结果揭示,慢性病数据集及其派生的 ML 模型普遍存在显著的性别和年龄相关不平等现象。因此,本文引入一种新型分析框架,将系统性任意性与准确率和数据复杂度等传统指标结合起来。对来自超过 25,000 名慢性病患者的数据进行分析后发现,性别相关差异较小,偏向于男性患者的预测准确率更高;年龄相关差异显著,准确率在年轻患者身上更好。值得注意的是,老年患者在七个数据集中的预测准确率不一致,这与更高的数据复杂度和较低的模型性能有关。这一发现表明,仅靠训练数据的 representativeness 并不能保证公平的结果,必须在将模型部署到临床环境之前解决模型的任意性问题。

关键词

引用

@article{arxiv.2412.19495,
  title  = {Disparate Model Performance and Stability in Machine Learning Clinical Support for Diabetes and Heart Diseases},
  author = {Ioannis Bilionis and Ricardo C. Berrios and Luis Fernandez-Luque and Carlos Castillo},
  journal= {arXiv preprint arXiv:2412.19495},
  year   = {2025}
}

备注

This paper will be presented in American Medical Informatics Association (AMIA) Informatics Summit Conference 2025 (Pittsburgh, PA). 10 pages, 2 figures, 5 tables