概念组件分析:LLM 概念提取的原则方法
机器学习
2026-01-30 v2
摘要
开发对大语言模型(LLM)的人类可理解解释日益至关重要,其在关键领域的部署需要可靠的解释性。机制可解释性通过从 LLM 激活值中提取人类可解释过程和概念来缓解相关问题。稀疏自编码器(SAEs)是从 LLM 内部表示分解出可解释且单语义概念的流行方法。尽管已取得实证性进展,但 SAEs 存在根本性理论歧义:LLM 表示与人类可解释概念之间的明确对应关系尚不明确。缺乏理论依据导致若干方法论挑战,包括难以设计原则方法和确定评估标准。本文表明,在轻度假设下,LLM 表示可近似为给定输入上下文下概念后验分布的线性混合,通过将概念视为隐变量的潜在变量模型实现。这激励了一种原则框架——概念组件分析(ConCA),旨在通过无监督线性解混过程恢复每个概念的对数后验分布。我们探讨了特定变体,即稀疏 ConCA,利用稀疏先验解决解混问题的固有欠致性。我们实现了 12 种稀疏 ConCA 变体,展示其在多个 LLM 上提取有意义概念的能力,提供了相对于 SAEs 的理论优势。
引用
@article{arxiv.2601.20420,
title = {Concept Component Analysis: A Principled Approach for Concept Extraction in LLMs},
author = {Yuhang Liu and Erdun Gao and Dong Gong and Anton van den Hengel and Javen Qinfeng Shi},
journal= {arXiv preprint arXiv:2601.20420},
year = {2026}
}