通过结构先验强化 LLM 在表格预测中的数值推理能力
机器学习
2026-03-11 v4 人工智能
摘要
表格预测传统上依赖于梯度提升决策树和深度学习模型,这些模型在特定任务中表现优异,但缺乏可解释性和可迁移性。推理型大语言模型(LLM)承诺具备跨任务的适应性和透明的推理轨迹,但其在表格数据上的潜力尚未被实现。为弥合这一差距,我们提出一种以置换相对策略优化(PRPO)为核心的推理框架,PRPO 是一种编码列置换不变性作为结构先验的强化学习方法。通过估计在保持标签不变的置换下的优势,PRPO 将稀疏奖励转化为稠密信号,激活 LLM 在有限监督下的隐含数值推理能力。广泛的实验表明,我们的方法在匹配完全监督基线的同时,在零样本设置中表现优异,性能与 32 shot 强基线相当。值得注意的是,我们的 8B 模型显著超越了更大的 LLM(DeepSeek-R1,685B),实现了最高可达 53.17% 的提升。
引用
@article{arxiv.2510.17385,
title = {Reinforcing Numerical Reasoning in LLMs for Tabular Prediction via Structural Priors},
author = {Pengxiang Cai and Zihao Gao and Wanchen Lian and Jintai Chen},
journal= {arXiv preprint arXiv:2510.17385},
year = {2026}
}