中文

概念基侧信道模型中准确性-可解释性权衡的量化

机器学习 2025-10-17 v2 人工智能

摘要

概念瓶颈模型(CBNMs)是一种深度学习模型,通过强制在瓶颈层上进行限制,以基于人类可理解概念的预测提供可解释性。然而,这一约束也限制了信息流动,常常导致预测准确性下降。概念侧信道模型(CSMs)通过引入侧信道来解决这一限制,该侧信道绕过瓶颈并携带额外的任务相关信息。虽然这提高了准确性,但同时也削弱了可解释性,因为预测可能依赖通过侧信道传输的不可解释表示。目前尚不存在一种原则性技术来控制这一根本性权衡。在本文中,我们填补了这一空白。首先,我们提出了一种统一的概率概念侧信道 meta 模型,将现有的 CSMs 作为特殊情况纳入其中。建立在该框架之上,我们引入了侧信道独立得分(SIS),这是一种衡量 CSM 依赖其侧信道程度的指标,通过对比使用和不使用侧信道信息所做出的预测来实现。我们提出了 SIS 正则化,该正则化显式惩罚侧信道的依赖性以提高可解释性。最后,我们分析了预测器的表达性和侧信道的依赖性如何共同塑造可解释性,揭示了不同 CSM 架构中固有的权衡。实证结果表明,准确率最高的 CSMs 在仅为准确率训练时表现出低的表示可解释性,而 SIS 正则化显著提高了其可解释性、可干预性以及所学可解释任务预测器的质量。我们的工作提供了用于以原则方式平衡 CSMs 中的准确性和可解释性的理论和实用工具。

关键词

引用

@article{arxiv.2510.05670,
  title  = {Quantifying the Accuracy-Interpretability Trade-Off in Concept-Based Sidechannel Models},
  author = {David Debot and Giuseppe Marra},
  journal= {arXiv preprint arXiv:2510.05670},
  year   = {2025}
}