可靠解释还是随机噪声?面向可解释人工智能的可靠性指标
机器学习
2026-02-06 v1 人工智能
机器学习
摘要
近年来,在能源系统、医疗、金融和自动驾驶等高风险领域,解释由复杂机器学习模型所作决定已变得至关重要。然而,这些解释的可靠性——即它们在现实、非对抗性变化下的稳定性和一致性——仍大体未被衡量。诸如SHAP和集成梯度(IG)等广泛使用的方法虽基于归因的公理理念,却在系统层次条件下(包括小输入扰动、相关表示和轻微模型更新)会出现显著差异。这种波动性削弱了解释的可靠性,因为可靠解释应在等效输入表示和小幅、保持性能的模型变更下保持一致。我们引入解释可靠性指数(ERI),这是一族衡量解释在四个可靠性公理下的稳定性的指标:对小输入扰动的鲁棒性、特征冗余下的一致性、模型演化中的平滑性以及对轻微分布性偏移的抗性。对于每个公理,我们推导出形式保证,包括Lipschitz型界限和时间稳定性结果。我们进一步提出ERI-T,用于衡量序列模型的时序可靠性,并引入ERI-Bench,旨在系统性地对解释可靠性进行压力测试,涵盖合成数据集和真实世界数据集。实验结果显示,流行解释方法在实际部署条件下普遍存在可靠性失效,表明解释在等价条件下的不稳定性。通过暴露并量化这些不稳定性,ERI实现了对解释可靠性的原则性评估,支持更可信的可解释人工智能(XAI)系统。
引用
@article{arxiv.2602.05082,
title = {Reliable Explanations or Random Noise? A Reliability Metric for XAI},
author = {Poushali Sengupta and Sabita Maharjan and Frank Eliassen and Shashi Raj Pandey and Yan Zhang},
journal= {arXiv preprint arXiv:2602.05082},
year = {2026}
}