持续取得更大进展:面向表格数据排行榜的思维链方法
机器学习
2025-05-20 v1
摘要
表格数据是机器学习中的基础数据格式,广泛用于竞赛和实际应用。表格模型——如梯度提升决策树和神经网络——的性能在不同数据集间可能存在显著差异,这是由于特征分布和任务特性的不同所致。在每个数据集上取得顶尖性能通常需要专门领域知识。为应对这种差异性,从业者常采用多个模型的预测进行聚合。然而,传统聚合策略通常依赖静态组合规则,缺乏实例级适应性。在本工作中,我们提出了一种面向表格预测的上下文集成框架,利用大语言模型(LLMs)对多个外部模型的预测进行动态、实例特定的整合。在不访问原始表格特征或语义信息的情况下,我们利用测试实例的最近邻和外部模型池的预测为其构建上下文。在此丰富上下文中,我们引入了表格思维链(CoT²),一种引导LLM进行多步、可解释推理的提示策略,使其向专家级决策持续取得更大进展。实验结果表明,我们的方法在广泛范围的表格数据集上优于经过良好调优的基线和标准集成技术。
引用
@article{arxiv.2505.13421,
title = {Make Still Further Progress: Chain of Thoughts for Tabular Data Leaderboard},
author = {Si-Yang Liu and Qile Zhou and Han-Jia Ye},
journal= {arXiv preprint arXiv:2505.13421},
year = {2025}
}