中文

一种利用混合重采样和集成学习的双流水线机器学习框架,用于自动化多类睡眠障碍筛查

机器学习 2026-02-10 v2

摘要

准确分类睡眠障碍,特别是失眠和睡眠呼吸暂停,对于降低长期健康风险和提高患者生活质量至关重要。然而,临床睡眠研究资源密集,难以扩展到人群水平的筛查。本文提出了一种双流水线机器学习框架,利用睡眠健康与生活方式数据集进行多类睡眠障碍筛查。该框架由两个并行处理流组成:一个统计流水线,利用互信息和线性判别分析处理线性可分性;另一个基于包装器的流水线,应用 Boruta 特征选择与自编码器进行非线性表示学习。为了解决类别不平衡问题,我们使用了混合 SMOTETomek 重采样策略。在实验中,Extra Trees 和 K 最近邻算法达到了 98.67% 的准确率,优于同一数据集上的近期基线。使用 Wilcoxon 符号秩检验的统计测试表明,相对于基线配置的改进是显著的,并且推理延迟保持在 400 毫秒以下。这些结果表明,所提出的双流水线设计支持准确且高效的自动化筛查,用于非侵入性睡眠障碍风险分层。

关键词

引用

@article{arxiv.2601.05814,
  title  = {A Dual Pipeline Machine Learning Framework for Automated Multi Class Sleep Disorder Screening Using Hybrid Resampling and Ensemble Learning},
  author = {Md Sultanul Islam Ovi and Muhsina Tarannum Munfa and G. M. M Miftahul Alam Adib and Syed Sabbir Hasan},
  journal= {arXiv preprint arXiv:2601.05814},
  year   = {2026}
}

备注

32 pages, 5 figures, 14 tables