数据分布影响基于对比学习的心电图基础模型的性能与泛化能力
机器学习
2025-09-15 v1 人工智能
信号处理
组织与器官
摘要
对比学习是一种广泛采用的自监督预训练策略,然而其对队列构成的依赖仍有待深入探索。我们提出了基于患者增强心电图对比(CAPE)基础模型,并在来自三大洲(北美洲、南美洲、亚洲)不同人群的四个队列(n = 5,203,352)上进行预训练。我们系统性地评估了队列人口统计学、健康状况和人群多样性如何影响预测任务的下游性能,同时还纳入了来自另一大洲(欧洲)的两个额外队列。我们发现,下游性能取决于预训练队列的分布特性,包括人口统计学和健康状况。此外,虽然使用多中心、人口统计学多样的队列进行预训练能提高分布内准确率,但它通过编码队列特定的伪影降低了我们对比方法的分布外(OOD)泛化能力。为解决这一问题,我们提出了分布内批次(IDB)策略,该策略在预训练期间保持队列内一致性,并增强了 OOD 鲁棒性。这项工作为开发临床上公平且可泛化的基础模型提供了重要见解。
引用
@article{arxiv.2509.10369,
title = {Data distribution impacts the performance and generalisability of contrastive learning-based foundation models of electrocardiograms},
author = {Gul Rukh Khattak and Konstantinos Patlatzoglou and Joseph Barker and Libor Pastika and Boroumand Zeidaabadi and Ahmed El-Medany and Hesham Aggour and Yixiu Liang and Antonio H. Ribeiro and Jeffrey Annis and Antonio Luiz Pinho Ribeiro and Junbo Ge and Daniel B. Kramer and Jonathan W. Waks and Evan Brittain and Nicholas Peters and Fu Siong Ng and Arunashis Sau},
journal= {arXiv preprint arXiv:2509.10369},
year = {2025}
}
备注
Currently under review at npj Digital Medicine