中文

Clarity:稀疏感知概念瓶颈模型中的灵活性-可解释性权衡

机器学习 2026-05-13 v2

摘要

深度学习模型在计算机视觉中的广泛采用加剧了对可解释性的关注。尽管表现出色,这些模型常被视为黑箱,人们对其决策过程的系统性调查仍有限。虽然已存在许多可解释性方法,但针对已学习表示的客观评估仍受限,尤其是那些依赖稀疏性来“诱导”可解释性的方法。在本工作中,我们研究了概念瓶颈模型(Concept Bottleneck Models, CBMs)中的建模选择如何影响概念表示的语义对齐。我们引入一种新型指标 Clarity,用于捕捉下游性能与概念激活稀疏性和精确度之间的相互作用。基于以具有真实概念注释的数据集为基础的可解释性评估框架,我们评估了 VLM-和属性预测器基的 CBMs,在三种 amortized 稀疏诱导策略(1\ell_10\ell_0 和基于 Bernoulli 的)以及文献中几种广泛使用的稀疏感知 CBM 方法。我们的实验揭示了一个关键的灵活性-可解释性权衡:模型通过偏离语义对齐来优化任务性能的能力。在此权衡下,不同方法即便在相当的性能水平上也表现出显著不同的行为。最后,我们通过原则性的人类研究,确认了 Clarity 与人类信任度显著更好地对齐 than standard evaluation metrics。

关键词

引用

@article{arxiv.2601.21944,
  title  = {Clarity: The Flexibility-Interpretability Trade-Off in Sparsity-aware Concept Bottleneck Models},
  author = {Konstantinos P. Panousis and Diego Marcos},
  journal= {arXiv preprint arXiv:2601.21944},
  year   = {2026}
}