中文

揭示大语言模型文本分类中的决策机制:稀疏自编码器提取有影响力且可解释的概念

计算与语言 2026-02-23 v2

摘要

稀疏自编码器(SAE)已成功用于探测大型语言模型(LLM),从其内部表示中提取可解释概念。这些概念是神经元激活的线性组合,对应于人类可解释特征。在本文中,我们调查了SAE基于的可解释性方法在句子分类中的有效性,该领域的方法尚未得到广泛探索。我们提出了一种针对文本分类定制的新型SAE模型ClassifSAE,利用专用分类头并纳入激活率稀疏损失。我们将这一架构与诸如ConceptShap、独立成分分析、HI-Concept以及标准TopK-SAE基线方法进行基准测试。我们的评估涵盖多个分类基准和不同的主干LLM。我们进一步通过两个新指标来丰富分析,这两个指标用于衡量概念基于解释的精确度,使用外部句子编码器。我们的实证结果表明,ClassifSAE提高了提取特征的因果性和可解释性。

关键词

引用

@article{arxiv.2506.23951,
  title  = {Unveiling Decision-Making in LLMs for Text Classification : Extraction of influential and interpretable concepts with Sparse Autoencoders},
  author = {Mathis Le Bail and Jérémie Dentan and Davide Buscaldi and Sonia Vanier},
  journal= {arXiv preprint arXiv:2506.23951},
  year   = {2026}
}