衡量 LLM 思考对象:金融表格分类中的 SHAP 可信度与可部署性
机器学习
2025-12-02 v1 计算与语言
摘要
大型语言模型(LLM)因为分类任务提供灵活的替代方案,相较于 LightGBM 等受信赖的经典机器学习模型通过零样本提示实现,受到广泛关注。然而,LLM 在结构化表格数据方面的可靠性尚不明确,尤其是在高风险应用如金融风险评估中。我们的研究系统性地评估了 LLM 并为其生成 SHAP 值。我们的分析显示,LLM 对特征影响的自我解释与其 SHAP 值之间存在差异,LLM 与 LightGBM SHAP 值之间也存在显著差异。这一发现凸显了 LLM 作为结构化金融建模独立分类器的局限性,但也让人对结合改进的可解释性机制与少量样本提示,使 LLM 在风险敏感领域可用持乐观态度。
引用
@article{arxiv.2512.00163,
title = {Measuring What LLMs Think They Do: SHAP Faithfulness and Deployability on Financial Tabular Classification},
author = {Saeed AlMarri and Mathieu Ravaut and Kristof Juhasz and Gautier Marti and Hamdan Al Ahbabi and Ibrahim Elfadel},
journal= {arXiv preprint arXiv:2512.00163},
year = {2025}
}
备注
7 pages, 3 figures, 3 tables, AAAI 2026 Deployable AI Workshop