中文

稀疏自编码器中特征关系的可视化探索:精选概念

计算与语言 2025-11-11 v1 机器学习

摘要

稀疏自编码器(SAE)已成为从大型语言模型(LLM)中发现可解释特征的强大工具,因其学习的稀疏方向。然而,提取的方向数量庞大,使得全面探索变得不可行。虽然常规嵌入技术如 UMAP 能揭示全局结构,但存在高维压缩伪影、数据重叠和误导性邻域扭曲等局限。本文提出一种聚焦探索框架,优先考虑精选概念及其对应的 SAE 特征,而非尝试同时可视化所有可用特征。我们呈现一种交互式可视化系统,将基于拓扑的视觉编码与降维技术结合,忠实地表示所选特征的局部和全局关系。这种混合方法使用户能够通过针对性、可解释的子集来探索 SAE 的行为,从而促进对潜在空间中概念表示的更深入、更细致的分析。

关键词

引用

@article{arxiv.2511.06048,
  title  = {Visual Exploration of Feature Relationships in Sparse Autoencoders with Curated Concepts},
  author = {Xinyuan Yan and Shusen Liu and Kowshik Thopalli and Bei Wang},
  journal= {arXiv preprint arXiv:2511.06048},
  year   = {2025}
}

备注

8 pages (5 main paper+3 refernce), 2 figures, pulished at Mechanistic Interpretability Workshop at NeurIPS 2025