集成 LLM 诱导的决策树以实现可解释且鲁棒的错误检测
计算与语言
2025-12-09 v1
摘要
错误检测(ED)旨在识别表格数据中不正确或不一致的单元格值,对于确保数据质量至关重要。最近最先进的错误检测方法利用大型语言模型(LLM)中嵌入的预训练知识和语义能力,直接标记单元格是否错误。然而,这种“LLM 作为标注器”的流程(1)依赖于黑箱的、隐式的决策过程,因此无法为检测结果提供可解释性,并且(2)对提示高度敏感,由于模型固有的随机性而产生不一致的输出,因此缺乏鲁棒性。为了解决这些局限性,我们提出了一种“LLM 作为诱导器”的框架,该框架采用 LLM 来诱导用于错误检测的决策树(称为 TreeED),并进一步集成多棵这样的树以进行共识检测(称为 ForestED),从而提高可解释性和鲁棒性。具体来说,基于从数据上下文、决策树规范和输出要求中导出的提示,TreeED 查询 LLM 以诱导决策树骨架,其从根到叶的决策路径指定了评估给定样本的逐步过程。每棵树包含三种类型的节点:(1)执行简单验证检查(例如,格式或范围)的规则节点,(2)捕获复杂模式(例如,函数依赖)的图神经网络(GNN)节点,以及(3)输出最终决策类型(错误或干净)的叶节点。此外,ForestED 采用基于不确定性的采样来获得多个行子集,使用 TreeED 为每个子集构建一棵决策树。然后,它利用基于期望最大化的算法,联合估计树的可靠性并优化共识错误检测预测。大量实验表明,我们的方法准确、可解释且鲁棒,其平均 F1 分数比最佳基线提高了 16.1%。
引用
@article{arxiv.2512.07246,
title = {Ensembling LLM-Induced Decision Trees for Explainable and Robust Error Detection},
author = {Mengqi Wang and Jianwei Wang and Qing Liu and Xiwei Xu and Zhenchang Xing and Liming Zhu and Wenjie Zhang},
journal= {arXiv preprint arXiv:2512.07246},
year = {2025}
}
备注
14 pages, 8 figures