探索最小反事实解释的能量景观:针对网络安全及其他领域的应用
人工智能
2025-03-25 v1 机器学习
摘要
反事实解释在可解释人工智能(XAI)中日益成为一种突出方法,提供对机器学习模型决策直观且可操作的见解。与其他传统特征归因方法不同,后者评估输入变量的重要性,而反事实解释则聚焦于识别改变模型预测所需的最小变更,提供一种贴近人类推理的“假设若如何”分析。在XAI的上下文中,反事实解释增强了透明度、可信度和公平性,提供的解释不仅可解释,而且直接可用于决策过程中。本文提出了一种新框架,将扰动理论和统计力学集成到可解释人工智能中,以生成最小反事实解释。我们对机器学习模型的预测函数进行局部Taylor展开,并将反事实搜索问题转化为在复杂景观上的能量最小化问题。随后,我们利用玻尔兹曼分布建模候选扰动的概率,并使用模拟退火进行迭代细化。我们的 метод系统性地识别改变模型预测所需的最小修改,同时保持合理性。在针对面向物联网环境中网络安全基准数据集的实验结果表明,我们的方法提供了可操作、可解释的反事实解释,并深入揭示了模型灵敏度和高维空间中决策边界的洞见。
引用
@article{arxiv.2503.18185,
title = {Exploring Energy Landscapes for Minimal Counterfactual Explanations: Applications in Cybersecurity and Beyond},
author = {Spyridon Evangelatos and Eleni Veroni and Vasilis Efthymiou and Christos Nikolopoulos and Georgios Th. Papadopoulos and Panagiotis Sarigiannidis},
journal= {arXiv preprint arXiv:2503.18185},
year = {2025}
}