中文

评估安全关键型自动目标识别系统中的可解释性:后置方法的局限性及面向稳健 XAI 的路径

人工智能 2026-05-08 v1

摘要

可解释人工智能(XAI)日益被认识为在安全关键环境中部署机器学习系统的关键因素。在自动目标识别(ATR)系统中,模型需处理图像、视频、雷达和多传感器数据,仅凭高预测性能已不足以满足需求。模型决策还必须具备可解释性、可靠性,并适用于验证。本文针对安全关键型 ATR 系统的可解释性方法进行系统性评估:我们识别了主要的 XAI 范式,包括基于显著性的、基于注意力的以及基于替代模型的方法,以及最近的检测感知型扩展。基于此,我们将可解释性形式化为一种以保证为导向的评估问题,引入了一套分类法,并评估了这些方法在四个关键维度上的表现:可解释性、鲁棒性、易受操纵的脆弱性,以及适用于验证和验证的性价比。分析揭示了当前后置解释方法的系统性局限性。特别是,我们推导出关键失效模式,如虚假解释、扰动下的不稳定性,以及由视觉上令人信服的输出引发的盲目信任。这些发现表明,广泛使用的 XAI 技术可能不足以支撑安全关键型部署。最后,我们讨论了对 ATR 系统的影响,并概述了通向更稳健、以因果为导向、且具有物理信息支撑的可解释性方法的方向。我们的结果强调,需超越视觉上合理的解释,转向支持可靠决策和系统级保证的方法。

关键词

引用

@article{arxiv.2605.05748,
  title  = {Evaluating Explainability in Safety-Critical ATR Systems: Limitations of Post-Hoc Methods and Paths Toward Robust XAI},
  author = {Vanessa Buhrmester and David Muench and Dimitri Bulatov and Michael Arens},
  journal= {arXiv preprint arXiv:2605.05748},
  year   = {2026}
}

备注

15 pages, 1 image 1 table, ICPR workshop