中文

量化后置模型解释中的解释性反转

机器学习 2025-04-15 v1 人工智能

摘要

后置解释方法通过对预测分配输入特征来提供解释。自然解释预期解释输入如何导致预测。于是一个根本性问题随之而来:这些解释是否无意中反转了输入与输出之间的自然关系?具体而言,解释是否在从输出而非反映真实决策过程来合理化预测?为调查此类解释性反转,我们提出一种 Inversion Quantification(IQ)框架,用于量化解释依赖输出的程度以及偏离忠实输入-输出关系的程度。使用该框架,我们在合成数据集上展示,诸如 LIME 和 SHAP 等广泛使用的方法在存在虚假关联时特别容易出现此类反转,涵盖表格、图像和文本领域。最后,我们提出一种称为 Reproduce-by-Poking(RBP)的简单且模型无关的后置解释方法的改进方案,通过集成前向扰动检查来实现。我们进一步表明,在 IQ 框架下,RBP 从理论上保证了对解释性反转的缓解。实证上,例如在合成数据上,RBP 可在不同著名后置解释方法和领域上平均降低约 1.8% 的解释性反转。

关键词

引用

@article{arxiv.2504.08919,
  title  = {Are We Merely Justifying Results ex Post Facto? Quantifying Explanatory Inversion in Post-Hoc Model Explanations},
  author = {Zhen Tan and Song Wang and Yifan Li and Yu Kong and Jundong Li and Tianlong Chen and Huan Liu},
  journal= {arXiv preprint arXiv:2504.08919},
  year   = {2025}
}