深入探究 TabPFN v2:理解其优势并扩展其能力
机器学习
2025-06-12 v2
摘要
表格数据集本质上是异构的,这给开发预训练基础模型带来了重大挑战。最近引入的基于 Transformer 的表格先验数据拟合网络 v2(TabPFN v2)在多样化的下游数据集上实现了前所未有的上下文学习性能,标志着表格基础模型的关键进展。在本文中,我们深入探究 TabPFN v2,以考察它如何有效处理异构性并实现高预测精度,并探索如何缓解其在高维、多类别和大规模任务中的局限性。我们发现,即使在提供随机化的属性 token 输入时,TabPFN v2 也能推断属性关系,从而消除了为解决异构性而显式学习特定于数据集的属性嵌入的需要。我们进一步表明,TabPFN v2 可以转化为特征提取器,揭示了其构建高度可分特征空间以实现准确预测的能力。最后,我们证明可以通过测试时分治策略解决 TabPFN v2 的局限性,从而无需重新训练即可实现可扩展的推理。通过揭示 TabPFN v2 成功背后的机制并引入扩展其适用性的策略,本研究为未来表格基础模型的设计提供了关键见解。
引用
@article{arxiv.2502.17361,
title = {A Closer Look at TabPFN v2: Understanding Its Strengths and Extending Its Capabilities},
author = {Han-Jia Ye and Si-Yang Liu and Wei-Lun Chao},
journal= {arXiv preprint arXiv:2502.17361},
year = {2025}
}