中文

机器学习中亚群有效性:针对心尿膜数据

机器学习 2025-12-02 v1 其他统计学

摘要

心尿膜数据集可用于训练深度学习模型,以自动化解释心脏超声,从而扩大准确读取诊断性图像的可及性。然而,患者的性别、性取向、种族和民族在这些数据集中报告不足,亚群特定的预测性能也未被评估。这些报告不足引发了关于亚群有效性的担忧,必须在模型部署之前进行研究和解决。本文我们表明,当前公开的心尿膜数据集无法消除亚群有效性的担忧。我们改进了两个数据集(TMED-2 和 MIMIC-IV-ECHO)的社会人口学报告。分析六个公开数据集后发现,未对性别多样化患者进行考虑,且许多种族和民族组的患者数量不足。我们进一步对两个已发布的主动脉狭窄检测模型在 TMED-2 上的进行探索性亚群分析。我们发现对于性别、种族和民族亚群,缺乏亚群有效性的证据。我们的发现表明,针对 underrepresented 亚群需要更多数据、改进的人口学报告以及面向亚群的分析,以证明未来工作中的亚群有效性。

关键词

引用

@article{arxiv.2512.00976,
  title  = {Subgroup Validity in Machine Learning for Echocardiogram Data},
  author = {Cynthia Feeney and Shane Williams and Benjamin S. Wessler and Michael C. Hughes},
  journal= {arXiv preprint arXiv:2512.00976},
  year   = {2025}
}