LinguaLens:通过稀疏自编码器解读大语言模型中的语言机制
计算与语言
2025-09-16 v2
摘要
大语言模型(LLMs)在需要复杂语言能力的任务上表现卓越,如指代消解和隐喻识别/生成。尽管LLMs具备惊人的能力,但其处理和表示语言知识的内部机制仍然鲜为人知。先前的语言机制研究受限于粗糙的细节粒度、受限的分析规模和狭窄的关注范围。本研究提出LinguaLens,一个基于稀疏自编码器(SAEs)的系统性、全面的框架,用于分析大语言模型中的语言机制。我们提取了涵盖四个维度(形态学、语法、语义和语用学)的中英文语言特征集合。通过采用反事实方法,我们构建了一个大规模反事实语言特征数据集,用于机制分析。我们的发现揭示了LLMs中语言知识的内在表征,发现了跨层和跨语言分布模式,并展示了控制模型输出的潜力。这一工作提供了一套系统的资源和方法,用于研究语言机制,提供了强有力的证据表明LLMs具备真正的语言知识,为未来研究中更具可解释性和可控性的语言建模奠定了基础。
引用
@article{arxiv.2502.20344,
title = {LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder},
author = {Yi Jing and Zijun Yao and Hongzhu Guo and Lingxu Ran and Xiaozhi Wang and Lei Hou and Juanzi Li},
journal= {arXiv preprint arXiv:2502.20344},
year = {2025}
}
备注
Accepted by EMNLP 2025 MainConference