中文

PulmoVec:基于 HeAR 基础模型构建的儿童呼吸声多任务分类的分层堆叠元学习架构

化学物理 2026-03-18 v1 计算工程、金融与科学 机器学习

摘要

背景:呼吸疾病是儿童死亡和併发症的主要原因,但肺听诊仍主观且受听者间变异性限制,尤其在儿童人群中。现有 AI 方法进一步受限于小数据集和单任务设计。我们开发了 PulmoVec,一个基于健康声学表示 (HeAR) 基础模型构建的多任务框架,用于儿童呼吸声分类。方法:在本回顾性分析中,针对 SPRSound 数据库,对 24,808 条事件级标注片段和 1,652 名儿童患者进行分析。训练了三个任务特定的分类器,用于筛查、声音模式识别和疾病组预测。将其 out-of-fold 概率输出与人口统计元数据在 LightGBM 堆叠元模型中组合,并通过集成投票将事件级预测聚合到患者层面。结果:在事件层面,筛查模型达到 ROC-AUC 为 0.96 (95% 置信区间 0.95-0.97),声音模式识别模型的宏观 ROC-AUC 为 0.96 (95% 置信区间 0.96-0.97),疾病组预测模型的宏观 ROC-AUC 为 0.94 (95% 置信区间 0.93-0.94)。在患者层面,疾病组分类准确率为 0.74 (95% 置信区间 0.71-0.77),加权 F1 分数为 0.73,宏观 ROC-AUC 为 0.91 (95% 置信区间 0.90-0.93)。堆叠在所有任务上均优于基线模型。结论:PulmoVec 将事件级声学表型与患者层面的临床分类相链接,支持基础模型驱动的数字化肺听诊在儿童呼吸医学中的潜力。跨中心外部验证在不同设备和真实世界条件下仍至关重要。

关键词

引用

@article{arxiv.2603.15686,
  title  = {Life cycle assessment for all organic chemicals},
  author = {Shaohan Chen and Tim Langhorst and Julian Nöhl and Christopher Oberschelp and Martin Pillich and Johannes Schilling and André Bardow},
  journal= {arXiv preprint arXiv:2603.15686},
  year   = {2026}
}

备注

24 pages, 9 figures