TabPFN-Wide:面向极端特征数的持续预训练
机器学习
2026-03-31 v2
摘要
从分子测量与病理学关系中揭示新见解是机器学习在生物医药领域的高影响力应用之一。该领域的数据通常仅包含少量观察值,但包含数千个可能噪声较大的特征,这给传统的表格机器学习方法带来了挑战。虽然以先验数据拟合的网络(prior-data fitted networks)正在涌现作为预测表格数据任务的基础模型,但当前的模型尚不适用于处理超过 500 个的特征计数。虽然特征降维可以实现其应用,但会阻碍特征重要性分析。我们提出了一种策略,通过对来自自定义先验的合成数据的持续预训练来扩展现有模型。 resulting model(即 TabPFN-Wide)在性能上与基础模型持平或更好,同时对噪声具有更好的鲁棒性。它能够无缝扩展到超过 30,000 个分类和连续特征,无论噪声水平如何,同时保持固有的可解释性,这一点对生物医药应用至关重要。我们的结果表明,先验信息驱动的适应性策略适用于增强基础模型处理高维数据的能力。在真实的 omics 数据集上,我们展示了该模型识别的许多最相关特征与先前的生物学发现相吻合,而另一些则为未来研究提供了潜在的起点。
引用
@article{arxiv.2510.06162,
title = {TabPFN-Wide: Continued Pre-Training for Extreme Feature Counts},
author = {Christopher Kolberg and Jules Kreuer and Jonas Huurdeman and Sofiane Ouaari and Katharina Eggensperger and Nico Pfeifer},
journal= {arXiv preprint arXiv:2510.06162},
year = {2026}
}