CAT:可解释概念基泰勒加法模型
机器学习
2024-08-01 v3
摘要
作为一种新兴的可解释技术,广义可加模型 (GAMs) 采用神经网络分别学习每个特征的非线性函数,然后通过线性模型组合以进行最终预测。虽然 GAMs 可在特征层面解释深度神经网络 (DNNs),但需要大量模型参数且易产生过拟合,使其难以训练和扩展。此外,在特征众多的真实数据集中,基于特征的解释对人类而言可读性下降。为此,近期研究转向概念基可解释方法。这些方法试图在作出预测前整合概念学习,以人类可理解的概念来解释预测。然而,这些方法需要领域专家广泛标注概念及其相关名称和真实值。在此基础上,我们提出了 CAT,即 novel 可解释 Concept-bAsed Taylor additive model,以简化此过程。CAT 不需要领域专家标注概念及其真实值。相反,它只需要用户简单地将输入特征划分为广泛的组,这可以通过快速的元数据审查轻松完成。具体而言,CAT 首先将每组输入特征嵌入一个一维高层次概念表示,然后将概念表示输入到一种新的白盒泰勒神经网络 (TaylorNet)。TaylorNet 旨在使用多项式学习输入与输出之间的非线性关系。跨越多个基准的评估结果表明,CAT 在性能上优于或可与基准相当,同时减少了大量模型参数的需求。重要的是,它可以通过人类可理解的高层次概念来解释模型预测。
引用
@article{arxiv.2406.17931,
title = {CAT: Interpretable Concept-based Taylor Additive Models},
author = {Viet Duong and Qiong Wu and Zhengyi Zhou and Hongjue Zhao and Chenxiang Luo and Eric Zavesky and Huaxiu Yao and Huajie Shao},
journal= {arXiv preprint arXiv:2406.17931},
year = {2024}
}