LLM 在表格数据上的决策树
机器学习
2025-12-11 v2
摘要
表格数据在医疗、金融等众多实际领域发挥着重要作用。随着大语言模型(LLM)近期成功的出现,首次将 LLM 扩展到表格数据领域的探索工作已 develop。大多数基于 LLM 的方法通常首先将表格数据序列化为自然语言描述,然后对这些序列化数据进行微调或直接推断。然而,这些方法存在两个关键固有问题:(i)数据视角:现有的数据序列化方法不具备对结构化表格数据的通用适用性,可能通过直接文本暴露带来隐私风险;(ii)模型视角:LLM 微调方法在表格数据方面存疑,基于输入长度限制的零样本学习可扩展性成为瓶颈。本工作探索了通过逻辑决策树规则作为中介将 LLM 集成到表格数据中的新思路,提出了一种基于 LLM 派生规则的决策树增强器,用于表格预测,即 DeLTa。所提出的 DeLTa 避免了表格数据序列化,可应用于完整数据学习设置,无需 LLM 微调。具体而言,我们利用 LLM 的推理能力,针对一组决策树规则重新设计改进的规则。此外,我们通过 LLM 生成的新规则提供一种校准方法,用于原始决策树,通过近似误差矢量来引导原始决策树预测,减少“错误”。最后,在多样化的表格基准测试上进行大量实验,表明该方法在性能上实现了业界最优水平。
引用
@article{arxiv.2505.17918,
title = {LLM Meeting Decision Trees on Tabular Data},
author = {Hangting Ye and Jinmeng Li and He Zhao and Dandan Guo and Yi Chang},
journal= {arXiv preprint arXiv:2505.17918},
year = {2025}
}