德勒兹表征假设
机器学习
2026-02-12 v1
摘要
我们提出了一种稀疏自编码器(SAE)的替代方案,作为一种简单有效的无监督方法,用于从神经网络中提取可解释概念。核心思想是对激活值的差异进行聚类,我们在判别分析框架内对此进行了形式化论证。为了增强提取概念的多样性,我们通过使用激活值的偏度对聚类进行加权来改进该方法。该方法与德勒兹将概念视为差异的现代观点相一致。我们在五个模型和三种模态(视觉、语言和音频)上评估了该方法,衡量了概念质量、多样性和一致性。我们的结果表明,所提出的方法在概念质量上超越了先前的无监督SAE变体,同时接近有监督基线,并且提取的概念能够引导模型的内部表征,证明了它们对下游行为的因果影响。
引用
@article{arxiv.2512.19734,
title = {The Deleuzian Representation Hypothesis},
author = {Clément Cornet and Romaric Besançon and Hervé Le Borgne},
journal= {arXiv preprint arXiv:2512.19734},
year = {2026}
}