逆向博弈网络:一个博弈论归因框架
机器学习
2026-05-08 v1 计算机视觉与模式识别
摘要
归因方法解释了哪些输入特征驱动了模型的预测,使其成为模型调试和机制可解释性的核心。然而,包括梯度、LRP 和 Transformer 特定规则在内的后向归因方法,缺乏一个可比较底层后向计算的共享框架。我们通过将后向归因重新构建为扩展网络图上的双人博弈来引入这样一个框架,该框架建立在 Gaubert 和 Vlassopoulos 的 ReLU 网络博弈之上。梯度和完整的 alpha-beta-LRP 族作为特定均衡下博弈轨迹上的积分出现,因此归因图成为轨迹分布的投影,而非主要对象。期望的解释属性,如局部化聚焦、对输入噪声的鲁棒性或稳定的注意力路由,可以被指定为博弈论概念,包括策略正则化、风险规避和扩展行动集,并直接转化为著名后向规则的新颖改编。在 ViT-B/16 上,alpha-beta-LRP 的一种此类选定改编在所有考虑的局部化指标上均优于先前特定于 Transformer 的后向方法。
引用
@article{arxiv.2605.06212,
title = {Playing the network backward: A Game Theoretic Attribution Framework},
author = {Jakob Paul Zimmermann and Jim Berend and Georg Loho and Sebastian Lapuschkin and Wojciech Samek},
journal= {arXiv preprint arXiv:2605.06212},
year = {2026}
}