TabPFN的透视:TabPFN及其内部表示的可解释性研究
机器学习
2026-01-14 v1
摘要
表格基础模型是为广泛的表格数据任务而设计的预训练模型。它们在各领域都表现出强大的性能,但其内部表示和学习到的概念仍然知之甚少。这种可解释性的缺乏使得研究这些模型如何处理和转换输入特征变得重要。在这项工作中,我们分析了模型隐藏表示中编码的信息,并考察了这些表示在各层之间的演变过程。我们进行了一组探测实验,测试早期层中是否存在线性回归系数、复杂表达式的中间值以及最终答案。这些实验使我们能够推理模型内部执行的计算。我们的结果提供了证据,表明有意义且结构化的信息存储在表格基础模型的表示中。我们观察到了与模型预测过程中涉及的中间量和最终量相对应的清晰信号。这让我们深入了解了模型如何细化其输入以及最终输出如何产生。我们的发现有助于更深入地理解表格基础模型的内部机制。它们表明这些模型编码了具体且可解释的信息,这使我们更接近使其决策过程更加透明和可信。
引用
@article{arxiv.2601.08181,
title = {TabPFN Through The Looking Glass: An interpretability study of TabPFN and its internal representations},
author = {Aviral Gupta and Armaan Sethi and Dhruv Kumar},
journal= {arXiv preprint arXiv:2601.08181},
year = {2026}
}