中文

面向不确定性感知的后验解释中的信息性扰动选择

机器学习 2026-03-18 v2 人工智能 机器学习

摘要

由于隐蔽的机器学习(ML)模型在广泛部署中的信任和伦理问题,亟需可靠的模型解释方法。后验模型中立的解释方法通过学习近似部署在感兴趣样本局部区域的黑盒ML模型的替代模型来应对这一挑战。在后验场景中,由于无法获取底层模型参数或训练数据,必须通过在感兴趣样本附近生成扰动输入及其相应模型预测来构建该局部邻域。我们提出了期望主动增益用于局部解释(Expected Active Gain for Local Explanations, EAGLE),一种后验模型中立的解释框架,将扰动选择形式化为信息论主动学习问题。通过自适应抽样最大化期望信息增益的扰动,EAGLE能够高效学习线性替代可解释模型,同时生成特征重要性分数及其不确定性/置信度估计。理论上,我们证明累计信息增益的尺度为O(dlogt)\mathcal{O}(d \log t),其中d为特征维数,t表示样本数;且样本复杂度随维度d线性增长,并随置信度参数1/δ1/\delta的对数增长。实验结果在表格和图像数据集上都印证了我们的理论结论,表明EAGLE在解释可重复性、邻域稳定性和扰动样本质量方面均优于Tilia、US-LIME、GLIME和BayesLIME等最新方法。

关键词

引用

@article{arxiv.2603.14894,
  title  = {Informative Perturbation Selection for Uncertainty-Aware Post-hoc Explanations},
  author = {Sumedha Chugh and Ranjitha Prasad and Nazreen Shah},
  journal= {arXiv preprint arXiv:2603.14894},
  year   = {2026}
}