中文

基于反事实感知的 Wasserstein 原型重建分类器

机器学习 2025-12-12 v1

摘要

反事实解释通过识别实现所需模型预测所必需的最小输入变更来提供可操作性洞察。除了解释性优势之外,反事实还可用于模型重建,其中会训练一个代理模型来复制目标模型的行为。本文表明,通过认识到反事实(通常位于决策边界附近)可作为两类类别的有益但不够代表性样本,从而显著提高模型重建效果。这在缺乏对标记数据的访问的情境下尤为有益。我们提出一种方法,将原始数据样本与反事实样本结合,以 Wasserstein 重心近似类原型,从而保留每个类别的底层分布结构。该方法提高了代理模型的质量,缓解了当反事实被简单地视为普通训练实例时常见的决策边界漂移问题。跨多个数据集的实验结果表明,我们的方法在保持目标模型保真度方面取得显著改善,验证了其有效性。

关键词

引用

@article{arxiv.2512.10878,
  title  = {Classifier Reconstruction Through Counterfactual-Aware Wasserstein Prototypes},
  author = {Xuan Zhao and Zhuo Cao and Arya Bangun and Hanno Scharr and Ira Assent},
  journal= {arXiv preprint arXiv:2512.10878},
  year   = {2025}
}

备注

Accepted by Actionable Interpretability Workshop at ICML 2025