中文

斯坦福睡眠基准:评估多肺睡眠预训练方法的睡眠基础模型

机器学习 2025-12-11 v1 人工智能

摘要

多肺睡眠图(polysomnography, PSG),作为睡眠分析的金标准,产生海量多模态临床数据,为利用自监督表征学习(SSRL)为睡眠基础模型预训练提供了机会。然而,睡眠基础模型的进展受到两个关键限制:(1)缺乏具有多样化任务的共享数据集和基准用于训练和评估,(2)缺乏对 SSRL 方法在睡眠相关任务上的系统评估。为此,我们引入斯坦福睡眠基准(Stanford Sleep Bench),该基准包含 17,467 项睡眠记录,总时长超过 163,000 小时,来自大型睡眠诊所,包括 13 项临床疾病预测任务以及睡眠分期、呼吸暂停诊断和年龄估计等标准睡眠相关任务。我们系统评估了 SSRL 预训练方法在斯坦福睡眠基准上的表现,评估四个下游任务:睡眠分期、呼吸暂停诊断、年龄估计和疾病及死亡风险预测。结果表明,多个预训练方法在睡眠分期、呼吸暂停诊断和年龄估计方面实现相当的性能。然而,在死亡风险和疾病预测方面,对比学习显著优于其他方法,同时在预训练期间收敛速度也更快。为促进可重复性并推动睡眠研究进展,我们将发布斯坦福睡眠基准数据集,以及预训练模型权重、训练管道和评估代码。

关键词

引用

@article{arxiv.2512.09591,
  title  = {Stanford Sleep Bench: Evaluating Polysomnography Pre-training Methods for Sleep Foundation Models},
  author = {Magnus Ruud Kjaer and Rahul Thapa and Gauri Ganjoo and Hyatt Moore and Poul Joergen Jennum and Brandon M. Westover and James Zou and Emmanuel Mignot and Bryan He and Andreas Brink-Kjaer},
  journal= {arXiv preprint arXiv:2512.09591},
  year   = {2025}
}