中文

AutoML-Med:面向医学表格数据的自动化机器学习框架

机器学习 2025-08-05 v1 人工智能

摘要

医学数据集通常受到缺失值、类别不平衡、异构特征类型以及特征数量远大于样本数量等问题的影响,这阻碍了机器学习模型在分类与回归任务中取得理想结果。本文介绍 AutoML-Med,一种专为应对这些挑战而设计的自动化机器学习(AutoML)工具,旨在最大限度地减少用户干预,并确定预处理技术与预测模型的最优组合。AutoML-Med 的架构采用拉丁超立方抽样(Latin Hypercube Sampling, LHS)来探索预处理方法,使用选定指标训练模型,并利用偏秩相关系数(Partial Rank Correlation Coefficient, PRCC)对最具影响力的预处理步骤进行精细优化。实验结果表明,AutoML-Med 在两种不同的临床场景下均有效,与现有最先进工具相比,在识别高风险患者至关重要的平衡准确率(balanced accuracy)与灵敏度(sensitivity)方面表现更优。AutoML-Med 能够在具有稀疏数据与类别不平衡的医学数据集中提升预测结果,凸显了其在简化医疗领域机器学习应用方面的潜力。

关键词

引用

@article{arxiv.2508.02625,
  title  = {AutoML-Med: A Framework for Automated Machine Learning in Medical Tabular Data},
  author = {Riccardo Francia and Maurizio Leone and Giorgio Leonardi and Stefania Montani and Marzio Pennisi and Manuel Striani and Sandra D'Alfonso},
  journal= {arXiv preprint arXiv:2508.02625},
  year   = {2025}
}

备注

8 pages, preprint for conference