概念学习的几何统一:基于概念锥的方法
人工智能
2025-12-09 v1 计算机视觉与模式识别
机器学习
摘要
两种可解释性传统并行发展但很少相互交流:概念瓶颈模型(CBMs),规定概念应该是什么,以及稀疏自编码器(SAEs),发现哪些概念涌现。虽然 CBMs 使用监督来将激活与人工标注的概念对齐,但 SAEs 依赖稀疏编码来发现涌现的概念。我们证明两种范式实例化了相同的几何结构:每个模型在激活空间中学习一组线性方向,其非负组合形成概念锥。监督和无监督方法的差异不在于类型,而在于如何选择该锥。基于这一观点,我们提出了两种范式之间的操作桥梁。CBMs 提供人工定义的参考几何,而 SAEs 可以通过其学习到的锥对 CBMs 的锥的近似或包含程度来评估。这种包含框架产生了将归纳偏置——如 SAE 类型、稀疏性或扩展率——与合理概念\footnote{我们采用 \citet{jacovi2020towards} 的术语,其区分忠实解释(准确反映模型计算)和合理解释(符合人类直觉和领域知识)。CBM 概念按构造是合理的——由人工选择或标注——尽管不一定忠实于组织数据流形的真实潜在因素。)的涌现相联系的定量指标。利用这些指标,我们在稀疏性和扩展因子中发现了最大化与 CBM 概念的几何和语义对齐的"最佳点"。总体而言,我们的工作通过共享的几何框架统一了监督和无监督的概念发现,为衡量 SAE 进展以及评估发现的概念与合理人类概念的对齐程度提供了原则性指标。
引用
@article{arxiv.2512.07355,
title = {A Geometric Unification of Concept Learning with Concept Cones},
author = {Alexandre Rocchi--Henry and Thomas Fel and Gianni Franchi},
journal= {arXiv preprint arXiv:2512.07355},
year = {2025}
}
备注
22 pages