生物医学中的标签稀缺:数据丰富的潜在因子发现增强表型预测
机器学习
2021-10-13 v1 神经元与认知
摘要
高质量数据积累在当今健康领域已趋于普遍。利用正常受试者的丰富数据来改进特定疾病中因数据稀缺而著称的监督 estimator 的机会正不断增加。我们证明,可从 UK Biobank 群体数据集导出低维嵌入空间,并用于增强对健康指标、生活方式与人口统计学特征的数据稀缺预测。由变分自编码器流形促成的表型预测通常比通过 PCA 或 Isomap 的降维更好地随未标记数据增加而扩展。半监督方法带来的性能提升可能将成为各类医学数据科学应用的重要成分。
引用
@article{arxiv.2110.06135,
title = {Label scarcity in biomedicine: Data-rich latent factor discovery enhances phenotype prediction},
author = {Marc-Andre Schulz and Bertrand Thirion and Alexandre Gramfort and Gaël Varoquaux and Danilo Bzdok},
journal= {arXiv preprint arXiv:2110.06135},
year = {2021}
}
备注
Accepted at NIPS 2017 Workshop on Machine Learning for Health