中文

面向概念表征评估的鲁棒度量

机器学习 2023-10-02 v1 人工智能

摘要

近期可解释性研究聚焦于基于概念的解释,即使用被称为概念的高层信息单元来解释深度学习模型。然而,概念学习模型已被证明易于在其表征中编码杂质,未能充分捕捉输入的有意义特征。尽管概念学习缺乏衡量此类现象的度量,解耦学习领域已探索数据中潜在变化因子的相关概念,并有大量度量可衡量此类因子的纯度。本文中,我们表明此类度量并不适用于概念学习,并提出了评估两种方法下概念表征纯度的新度量。我们展示了这些度量相对于已有度量的优势,并论证了它们在评估概念表征及其上所施加干预的鲁棒性方面的效用。此外,我们展示了它们对来自两个家族的最先进方法进行基准测试的效用,并发现与常见假设相反,仅监督本身可能不足以获得纯概念表征。

关键词

引用

@article{arxiv.2301.10367,
  title  = {Towards Robust Metrics for Concept Representation Evaluation},
  author = {Mateo Espinosa Zarlenga and Pietro Barbiero and Zohreh Shams and Dmitry Kazhdan and Umang Bhatt and Adrian Weller and Mateja Jamnik},
  journal= {arXiv preprint arXiv:2301.10367},
  year   = {2023}
}

备注

To appear at AAAI 2023