中文

TabSHAP

机器学习 2026-04-24 v1 计算与语言

摘要

大型语言模型(LLM)通过对序列化表格数据进行微调正在成为传统基于树的模型的强大替代方案,尤其适用于异构或上下文丰富的数据集。然而,由于缺乏可靠的可解释性,其部署在高风险领域受到阻碍;现有方法常依赖全局线性代理或标量概率偏移,这些方法无法捕捉模型的完整概率不确定性。在本工作中,我们引入TabSHAP,这是一个面向LLM-based表格分类器的模型无关可解释性框架,旨在直接归因于查询中局部决策逻辑。通过适应一种基于Shapley比例抽样联盟估计器,使用完整输入和被掩码输入类别分布之间的 Jensen-Shannon 散度,TabSHAP量化每个特征的分布式影响,而非简单的预测翻转。为与表格语义相吻合,我们在序列化键:值字段级别(而非单个子词标记)进行掩码处理。针对Adult收入和Heart Disease基准测试进行实验验证,结果表明TabSHAP能够隔离关键诊断特征,显著优于随机基线和XGBoost代理。我们进一步对相同测试实例和TabSHAP设置进行距离度量消失实验:用KL或L1替换JSD在相似性步骤中重新计算归因,然后在所有三个方法下比较删除可信度。

关键词

引用

@article{arxiv.2604.21120,
  title  = {TabSHAP},
  author = {Aryan Chaudhary and Prateek Agarwal and Tejasvi Alladi},
  journal= {arXiv preprint arXiv:2604.21120},
  year   = {2026}
}