中文

SLEEPYLAND:信任始于自动睡眠分期模型的公平评估

机器学习 2025-06-12 v2

摘要

尽管深度学习在自动睡眠分期方面取得了进展,但临床采用仍然有限,原因包括公平模型评估的挑战、跨多样化数据集的泛化、模型偏差以及人工标注的变异性。我们提出 SLEEPYLAND,一个开源的睡眠分期评估框架,旨在解决这些障碍。它包含超过 220,000 小时的域内(ID)睡眠记录和超过 84,000 小时的域外(OOD)睡眠记录,涵盖广泛的年龄、睡眠-觉醒障碍和硬件配置。我们发布了基于高性能 SoA 架构的预训练模型,并在单通道和多通道 EEG/EOG 配置下对其进行标准化评估。我们引入 SOMNUS,一个通过软投票跨架构和通道配置组合模型的集成方法。SOMNUS 在二十四个不同数据集上取得了稳健性能,宏 F1 分数在 68.7% 至 87.2% 之间,在 94.9% 的情况下优于单个模型。值得注意的是,SOMNUS 超越了之前的 SoA 方法,包括比较模型在域内训练而 SOMNUS 将相同数据视为域外的情况。利用 BSWR 的子集(N=6,633),我们量化了与年龄、性别、AHI 和 PLMI 相关的模型偏差,表明尽管集成提高了鲁棒性,但没有哪种模型架构能够一致地最小化性能和临床标志物估计中的偏差。在域外多标注数据集(DOD-H、DOD-O)的评估中,SOMNUS 超越了最佳人工评分者,即 DOD-H 上 MF1 为 85.2% 对 80.8%,DOD-O 上为 80.2% 对 75.9%,比任何个体专家更好地复现了评分者共识(健康/OSA 队列的 k = 0.89/0.85,ACS = 0.95/0.94)。最后,我们引入集成分歧指标——基于熵和基于模型间分歧的指标——以预测评分者分歧区域,其 ROC AUC 最高达 0.828,为人类不确定性提供了一个数据驱动的代理。

关键词

引用

@article{arxiv.2506.08574,
  title  = {SLEEPYLAND: trust begins with fair evaluation of automatic sleep staging models},
  author = {Alvise Dei Rossi and Matteo Metaldi and Michal Bechny and Irina Filchenko and Julia van der Meer and Markus H. Schmidt and Claudio L. A. Bassetti and Athina Tzovara and Francesca D. Faraci and Luigi Fiorillo},
  journal= {arXiv preprint arXiv:2506.08574},
  year   = {2025}
}

备注

41 pages, 4 Figures, 7 Tables