中文

ConceptViz:用于探索大型语言模型中概念的可视化分析方法

计算与语言 2025-09-26 v1 人工智能

摘要

大型语言模型(LLM)在广泛的自然语言任务上取得了显著的性能,但理解LLM如何内部表示知识仍是一个重大挑战。尽管稀疏自编码器(SAE)作为从LLM中提取可解释特征的有前景技术,SAE特征本身不一定与人类可理解的概念对齐,使其解释负担沉重且耗时。为弥合SAE特征与人类概念之间的鸿沟,我们提出ConceptViz,一个用于探索LLM中概念的可视化分析系统。ConceptViz实施了一种novel identification => interpretation => validation流程,使用户能够使用感兴趣的概念查询SAEs,交互式地探索概念到特征的对齐情况,并通过模型行为验证来验证对应关系。我们通过两种使用场景和一个用户研究演示了ConceptViz的有效性。我们的结果表明,ConceptViz通过简化发现和验证LLM中有意义概念表示的过程,提升了可解释性研究,最终帮助研究人员构建更准确的LLM特征心理模型。我们的代码和用户指南已公开于https://github.com/Happy-Hippo209/ConceptViz/。

关键词

引用

@article{arxiv.2509.20376,
  title  = {ConceptViz: A Visual Analytics Approach for Exploring Concepts in Large Language Models},
  author = {Haoxuan Li and Zhen Wen and Qiqi Jiang and Chenxiao Li and Yuwei Wu and Yuchen Yang and Yiyao Wang and Xiuqi Huang and Minfeng Zhu and Wei Chen},
  journal= {arXiv preprint arXiv:2509.20376},
  year   = {2025}
}