中文

通过稀疏自编码器中的多语言平均化解耦概念语义

计算与语言 2025-08-21 v1 人工智能

摘要

将大型语言模型(LLMs)与形式化知识表示和推理相结合,是解决其缺陷的一种有前景的方法。嵌入和稀疏自编码器被广泛用于表示文本内容,但其语义与句法和语言特定信息纠缠在一起。我们提出了一种方法,通过平均化由稀疏自编码器导出的概念激活值,来隔离大型语言模型中的概念语义。我们从OWL本体类创建英文文本表示,将英文翻译成法文和中文,然后将这些文本作为提示输入到Gemma 2B LLM中。利用开源的Gemma Scope稀疏自编码器套件,我们获得了每个类和语言版本的概念激活值。我们对不同语言的激活值进行平均,以得出概念平均值。然后,我们将这些概念平均值与本体类之间的真实映射关系进行关联。我们的结果强烈表明,与单一语言相比,概念平均值更符合类之间的真实关系。这一结果暗示了一种新技术,能够以更高的准确性对内部网络状态进行机制性解释。

关键词

引用

@article{arxiv.2508.14275,
  title  = {Disentangling concept semantics via multilingual averaging in Sparse Autoencoders},
  author = {Cliff O'Reilly and Ernesto Jimenez-Ruiz and Tillman Weyde},
  journal= {arXiv preprint arXiv:2508.14275},
  year   = {2025}
}