塌造先验:合成任务分布如何决定表格基础模型的质量
机器学习
2026-05-20 v1 人工智能
摘要
决定表格基础模型质量的因素是什么?在语言或视觉领域,表格基础模型几乎完全依赖于合成预训练分布来获得归纳偏置,但这些分布的设计仍然鲜为人知。标准的合成先验过于‘well-behaved’:它们省略了决定部署鲁棒性的不规则性和失效模式。我们引入了 O'Prior,这是一种围绕四个耦合组件构建的组合化现实先验:一个跨越多样功能家族的层次化SCM元生成器;覆盖异构边际分布、缺失情况和目标变换的模块化现实引擎;一个显式应力模块,用于注入混杂和支持-查询不匹配;以及受课程管控、无泄漏的生成协议。为将先验设计 isolating 为科学变量,我们保持架构、优化器和计算预算不变,仅改变合成任务分布。O'Prior 在真实表格基准测试中,无论是在哪些特征分布不规则的情形下,都能在下游准确率和鲁棒性方面获得一致且显著的提升。消融实验确认,机制多样性、现实组合性和移位感应应力每个因素都独立贡献了,它们的效果并非可互换的。这一结果确立了合成先验构建为表格基础模型质量的第一因素,而这一因素在过去鲜为人知。
引用
@article{arxiv.2605.18971,
title = {Shaping the Prior: How Synthetic Task Distributions Determine Tabular Foundation Model Quality},
author = {Mohamed Bouadi and Nassim Bouarour and Varun Kulkarni and Shivam Dubey and Aditya Tanna and Vinay Kumar Sankarapu},
journal= {arXiv preprint arXiv:2605.18971},
year = {2026}
}