中文

X-SHIELD:面向可解释人工智能的正则化方法

人工智能 2025-06-17 v3

摘要

随着人工智能系统在各领域的普及,可解释性需求日益增长,称为可解释人工智能(XAI)。现有工作主要致力于生成和评估黑箱模型的解释,而关键缺口在于通过这些评估直接增强模型。必须考虑利用解释过程改善模型质量、在训练中进行反馈的潜力。XAI 可用于在提升可解释性的同时提高模型性能。基于此观点,本文引入了 Transformation - Selective Hidden Input Evaluation for Learning Dynamics(T-SHIELD),这是一套旨在通过隐藏输入特征来提高模型质量的正则化方法族。在该族方法中,我们提出了 XAI - SHIELD(X-SHIELD),这是一种用于可解释人工智能的正则化方法,它利用解释选择要隐藏的特定特征。与传统方法不同,X-SHIELD 正则化 seamless 地集成到目标函数中,既提高模型的可解释性,又提升性能。在基准数据集上的实验验证表明,X-SHIELD 在提高性能和整体可解释性方面均显示出有效性。通过实验比较有无 X-SHIELD 正则化的模型,进一步分析探讨了其设计选择背后的理由。这一工作表明,X-SHIELD 正则化是发展可靠人工智能正则化方法的有前景的途径。

关键词

引用

@article{arxiv.2404.02611,
  title  = {X-SHIELD: Regularization for eXplainable Artificial Intelligence},
  author = {Iván Sevillano-García and Julián Luengo and Francisco Herrera},
  journal= {arXiv preprint arXiv:2404.02611},
  year   = {2025}
}

备注

18 pages, 9 figures