面向临床预测的判别表示学习
机器学习
2026-03-24 v1
摘要
医疗领域的基础模型大多采取自然语言处理和计算机视觉中继承的自监督预训练目标,强调在下游适配前的重构和大规模表示学习。我们在以结果为导向的临床预测场景中重新审视这一范式,认为在高质量监督信息可得时,直接对齐结果可能提供比生成式预训练更强的归纳偏置。我们提出一种监督深度学习框架,通过最大化类间间隔相对于类内方差来显式塑造表示几何,从而将模型容量集中于临床上有意义的维度。在包括死亡率和再入院率预测在内的多个纵向电子健康记录任务中,我们的方法在匹配的模型容量下持续优于遮盖式、自回归和对比式预训练基线。该方法提高了判别性、校准性和样本效率,同时将训练管道简化为单阶段优化。这些发现表明,在低熵、以结果为导向的医疗保健领域,监督信息可作为表示学习的统计最优驱动因素,挑战了大规模自监督预训练是获得强大临床性能的必需条件这一假设。
引用
@article{arxiv.2603.20921,
title = {Discriminative Representation Learning for Clinical Prediction},
author = {Yang Zhang and Li Fan and Samuel Lawrence and Shi Li},
journal= {arXiv preprint arXiv:2603.20921},
year = {2026}
}