在大型语言模型中识别线性关系概念
计算与语言
2024-04-02 v2 人工智能
摘要
Transformer语言模型(LM)已被证明将概念表示为隐藏激活潜在空间中的方向。然而,对于任意人类可解释的概念,我们如何找到其在潜在空间中的方向?我们提出一种称为线性关系概念(LRC)的技术,通过首先将主体与客体之间的关系建模为线性关系嵌入(LRE)来寻找对应于人类可解释概念的概念方向。我们发现反转LRE并使用较早的客体层是一种寻找概念方向的强大技术,优于标准的黑盒探测分类器。我们在作为概念分类器的性能以及因果改变模型输出的能力两方面对LRC进行了评估。
引用
@article{arxiv.2311.08968,
title = {Identifying Linear Relational Concepts in Large Language Models},
author = {David Chanin and Anthony Hunter and Oana-Maria Camburu},
journal= {arXiv preprint arXiv:2311.08968},
year = {2024}
}
备注
To be published in NAACL 2024