探索语言模型概念空间
计算与语言
2026-03-26 v1 人工智能
摘要
稀疏自编码器(SAEs)训练于大型语言模型激活后,输出数千个特征,使其能够映射到人类可解释概念。当前对这些特征进行分析的主要做法依赖于检查 top-激活示例、手动浏览 individual features 或对感兴趣的概念执行语义搜索,这使得在规模上进行概念的探索性发现变得困难。在本文中,我们提出了 Concept Explorer,一个用于后处理 SAE 特征探索的可扩展交互式系统,该系统使用分层邻域嵌入来组织概念解释。我们的 method 构建 SAE feature embeddings 的多分辨率流形,并支持从粗糙概念 cluster 到细粒度 neighborhood 的渐进导航,支持发现、比较和 relationship analysis among concepts。我们演示了在 SmolLM2 上提取的 SAE features 上展示 Concept Explorer 的实用性,其中它揭示了连贯的高层结构、有意义的 subcluster 以及难以通过现有工作流程识别的独特稀有概念。
引用
@article{arxiv.2603.23524,
title = {Navigating the Concept Space of Language Models},
author = {Wilson E. Marcílio-Jr and Danilo M. Eler},
journal= {arXiv preprint arXiv:2603.23524},
year = {2026}
}