重新思考 XAI 评估:面向高风险场景的以人为中心的Shapley基准审计
机器学习
2026-04-27 v1 人工智能
人机交互
摘要
Shapley 值是可解释人工智能的基石,但其在竞争性变体中的广泛应用导致生态体系碎片化,实践部署缺乏共识。虽然理论差异已充分阐述,但评估仍依赖量化代理,其与人类实用性对齐性未获验证。本文采用统一的 amortization 框架,隔离八种Shapley变体在运营风险工作流程中低延迟约束下的语义差异。我们在四个风险数据集和真实世界的欺诈检测环境中进行大规模实证评估,涉及专业分析师及3735例案件审查。结果揭示根本性错位:标准量化指标如稀疏性与忠诚度,与人类感知清晰度与决策效用脱节。此外,尽管无一种形式体系提升客观分析师绩效,但解释始终提升决策信心,凸示高风险场景中自动化偏见的关键风险。这些发现表明当前评估代理不足以预测下游人类影响,本文提供基于证据的指导方针,用于在运营决策系统中选择形式体系与评估指标。
引用
@article{arxiv.2604.22662,
title = {Rethinking XAI Evaluation: A Human-Centered Audit of Shapley Benchmarks in High-Stakes Settings},
author = {Inês Oliveira e Silva and Sérgio Jesus and Iker Perez and Rita P. Ribeiro and Carlos Soares and Hugo Ferreira and Pedro Bizarro},
journal= {arXiv preprint arXiv:2604.22662},
year = {2026}
}