中文

TabSieve:基于表格内显式证据选择的表格预测方法

机器学习 2026-02-13 v1 人工智能

摘要

表格预测可从表格中的少量行作为零样本证据,但现有表格模型通常进行逐实例推理,LLM 基于提示的方法往往脆弱。模型未能一致地利用相关行,噪声上下文会降低性能。为解决此挑战,我们提出了 TabSieve,一个显式且可审计的证据使用框架。给定表格和查询行,TabSieve 首先选择一小组信息丰富的行作为证据,然后在所选证据条件下预测缺失的目标。为实现此功能,我们通过强大教师模型结合严格筛选,从 331 个真实表格中合成高质量推理轨迹,构建了 TabSieve-SFT-40K。进一步引入 TAB-GRPO,即一种强化学习配方,联合优化证据选择和预测正确性,使用独立奖励,并通过动态任务优势平衡来稳定混合回归和分类训练。在 75 个分类表格和 52 个回归表格的 held-out 测试集上实验表明,TabSieve 在各种样本数预算下均能显著提升性能,分类任务平均提升 2.92%,回归任务平均提升 4.45%。进一步分析表明,TabSieve 更集中地注意所选证据,从而提高了对噪声上下文的鲁棒性。

关键词

引用

@article{arxiv.2602.11700,
  title  = {TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction},
  author = {Yongyao Wang and Ziqi Miao and Lu Yang and Haonan Jia and Wenting Yan and Chen Qian and Lijun Li},
  journal= {arXiv preprint arXiv:2602.11700},
  year   = {2026}
}

备注

13 pages