PulmoVec:基于 HeAR 基础模型构建的儿童呼吸声多任务分类的分层堆叠元学习架构
化学物理
2026-03-18 v1 计算工程、金融与科学
机器学习
摘要
背景:呼吸疾病是儿童死亡和併发症的主要原因,但肺听诊仍主观且受听者间变异性限制,尤其在儿童人群中。现有 AI 方法进一步受限于小数据集和单任务设计。我们开发了 PulmoVec,一个基于健康声学表示 (HeAR) 基础模型构建的多任务框架,用于儿童呼吸声分类。方法:在本回顾性分析中,针对 SPRSound 数据库,对 24,808 条事件级标注片段和 1,652 名儿童患者进行分析。训练了三个任务特定的分类器,用于筛查、声音模式识别和疾病组预测。将其 out-of-fold 概率输出与人口统计元数据在 LightGBM 堆叠元模型中组合,并通过集成投票将事件级预测聚合到患者层面。结果:在事件层面,筛查模型达到 ROC-AUC 为 0.96 (95% 置信区间 0.95-0.97),声音模式识别模型的宏观 ROC-AUC 为 0.96 (95% 置信区间 0.96-0.97),疾病组预测模型的宏观 ROC-AUC 为 0.94 (95% 置信区间 0.93-0.94)。在患者层面,疾病组分类准确率为 0.74 (95% 置信区间 0.71-0.77),加权 F1 分数为 0.73,宏观 ROC-AUC 为 0.91 (95% 置信区间 0.90-0.93)。堆叠在所有任务上均优于基线模型。结论:PulmoVec 将事件级声学表型与患者层面的临床分类相链接,支持基础模型驱动的数字化肺听诊在儿童呼吸医学中的潜力。跨中心外部验证在不同设备和真实世界条件下仍至关重要。
引用
@article{arxiv.2603.15686,
title = {Life cycle assessment for all organic chemicals},
author = {Shaohan Chen and Tim Langhorst and Julian Nöhl and Christopher Oberschelp and Martin Pillich and Johannes Schilling and André Bardow},
journal= {arXiv preprint arXiv:2603.15686},
year = {2026}
}
备注
24 pages, 9 figures