中文

面向可重复性与可解释性的机器学习稳定化:一种面向主题特定洞察的新型验证方法

机器学习 2024-12-24 v1 机器学习

摘要

机器学习正在通过提高诊断准确性和个性化治疗方式变革医学研究。大型数据集上训练的通用 ML 模型识别跨人群的广泛模式,但其有效性常因人类生物学的多样性受限。这导致对使用个体数据进行更精确预测的主题特定模型产生兴趣。然而,这些模型成本高昂且难以开发。为此,我们提出了一种新型验证方法,该方法利用通用 ML 模型确保在群组和主题特定水平上可重复的性能和稳健的特征重要性分析。我们在九个数据集上测试了单个随机森林 (RF) 模型,该数据集在领域、样本量和人口学特征方面各不相同。针对性能和特征重要性一致性应用了不同的验证技术。为引入可变性,我们对每个主题执行了最高达400次的试验,随机为每个试验设置 ML 算法的随机种子。这为每个主题生成了400个特征集,我们从中识别出每个主题的主要特征。随后从所有主题特定结果中导出了一组群组特定的特征重要性。我们将方法与常规验证方法就绩效和特征重要性一致性进行了比较。我们的方法通过随机种子变化的重复试验,始终在主题水平识别关键特征,并在单一通用模型中改进了群组水平的特征重要性分析。主题特定模型解决了生物学变异性问题,但资源密集型。我们的新型验证技术在单一通用模型中提供了一致的特征重要性和改进的准确率,为临床研究提供了一种实用且可解释的替代方案。

关键词

引用

@article{arxiv.2412.16199,
  title  = {Stabilizing Machine Learning for Reproducible and Explainable Results: A Novel Validation Approach to Subject-Specific Insights},
  author = {Gideon Vos and Liza van Eijk and Zoltan Sarnyai and Mostafa Rahimi Azghadi},
  journal= {arXiv preprint arXiv:2412.16199},
  year   = {2024}
}

备注

25 pages, 7 figures