从理性主义者学习:提炼中间可解释理由
机器学习
2026-05-29 v2 人工智能
摘要
鉴于深度神经网络 (DNN) 的广泛应用,尤其在高风险领域,DNN 的可解释性受到 increased 注意。理由提取 (RE) 的基本思想是通过 select-predict 架构为 DNN 提供可解释设计框架,其中两个神经网络分别学习特征选择和预测。仅凭最终任务预测的远程监督,学习选择特征子集(即理由)的过程需要在所有可能的特征组合空间中进行搜索,这在计算上具有挑战性,更难以在基础神经网络能力不足时实现。为提高基于不够强大或较小神经网络(即学生)的 RE 模型的预测性能,我们提出 REKD (Rationale Extraction with Knowledge Distillation),其中学生 RE 模型除了自身的 RE 优化外,还从教师(即 rationalist)的理由和预测中学习。这种对 RE 的结构调整与人类从可解释且可验证知识中高效学习的方式高度吻合。由于该方法对神经网络模型具有agnostic 性质,任何黑箱神经网络都可作为 backbone 模型。为演示 REKD 的可行性,我们使用多个 BERT 和 vision transformer (ViT) 模型变体进行实验。我们在语言和视觉分类数据集(即 IMDB 电影评论、CIFAR 10 和 CIFAR 100)上的实验表明,REKD 在显著提升学生 RE 模型的预测性能方面具有显著优势。
引用
@article{arxiv.2601.22531,
title = {Learn from A Rationalist: Distilling Intermediate Interpretable Rationales},
author = {Jiayi Dai and Randy Goebel},
journal= {arXiv preprint arXiv:2601.22531},
year = {2026}
}
备注
Accepted to the 43rd International Conference on Machine Learning (ICML 2026)