中文

Tabular 基础模型的主动原语学习

机器学习 2026-03-31 v1

摘要

主动学习 (Active Learning, AL) 通过查询信息性样本来减少标注成本,但在表格设置中,其冷启动收益往往有限,因为当模型在极少标签下训练时,不可靠的不确定性估计会限制其效果。表格基础模型如 TabPFN 通过原语学习 (in-context learning, ICL) 提供校准的概率预测,即无需任务特定的权重更新,从而实现 AL 场景,在该场景中,标注上下文 - 而非参数 - 是逐步优化的目标。我们形式化 Tabular 主动原语学习 (Tab-AICL) 并通过四种获取规则实现:不确定性 (TabPFN-Margin)、多样性 (TabPFN-Coreset)、不确定性-多样性混合 (TabPFN-Hybrid) 以及可扩展的两阶段方法 (TabPFN-Proxy-Hybrid),该方法先通过轻量线性代理筛选候选样本,再进行 TabPFN 基于选择。针对 20 个分类基准,Tab-AICL 在冷启动样本效率上优于重新训练的梯度提升基线 (CatBoost-Margin 和 XGBoost-Margin),以归一化 AULC 测量,样本数最高可达100个。

关键词

引用

@article{arxiv.2603.27385,
  title  = {Active In-Context Learning for Tabular Foundation Models},
  author = {Wilailuck Treerath and Fabrizio Pittorino},
  journal= {arXiv preprint arXiv:2603.27385},
  year   = {2026}
}

备注

8 pages, 4 figures, 6 tables