VIP-COP:表格基础模型的上下文优化
机器学习
2026-05-14 v1
摘要
表格基础模型(TFMs)已成为一种强大的范式,用于在结构化数据上进行原地学习,使其能够在无需任务特定训练的情况下直接预测新的表格任务。然而,其有效性受到上下文长度限制的制约,这限制了其适用于中等规模数据,并在推理时间数据超过预训练分布时降低性能。我们的工作引入了 VIP-COP,即估计训练样本和特征对预测价值的重要性,以便进行困难上下文优化。其显式的选择机制抑制噪声,隔离具有影响力的数据,使模型也能从数据增强中受益,优先选择高价值的增强样本和特征。VIP-COP(i)快速,通常在优化几分钟内即可提升性能,基于在线 KernelSHAP 回归的迭代细化、价值导向的上下文抽样和多保真度修剪;(ii)预算感知且可持续运行,随着额外计算资源的增加而持续改进,不同于产生固定上下文的启发式方法;(iii)模型感知但完全黑箱,无需访问模型内部,使其兼容专有和开源 TFMs;(iv)可解释,识别离散的“非常重要的预测因子”(样本和特征),最大化信噪比,这使其(v)稳健,隔离高价值数据与噪声。与软提示优化相比,后者需要模型梯度,产生抽象潜在标记,且缺乏显式信噪比判别。大规模高维测试表明,VIP-COP 在包括数据增强和数据噪声情形的广泛基准上一致优于启发式和优化基准,在 TFMs 的测试时上下文细化方面树立了新的最佳水平。
引用
@article{arxiv.2605.12904,
title = {VIP-COP: Context Optimization for Tabular Foundation Models},
author = {Yilong Chen and Xueying Ding and Leman Akoglu},
journal= {arXiv preprint arXiv:2605.12904},
year = {2026}
}