真理的几何:大语言模型真/假数据集表征中涌现的线性结构
人工智能
2024-08-20 v3
摘要
大语言模型(LLMs)具有令人印象深刻的能力,但容易输出不实信息。近期工作开发了通过在大语言模型内部激活上训练探针来推断其是否在说真话的技术。然而,这一研究方向存在争议,一些作者指出了这些探针在基本泛化方式上的失败以及其他概念问题。在本工作中,我们使用由简单真/假陈述组成的高质量数据集,详细研究大语言模型真理表征的结构,并借鉴三条证据线:1. 大语言模型真/假陈述表征的可视化,其揭示了清晰的线性结构。2. 在一个数据集上训练的探针泛化到不同数据集的迁移实验。3. 通过对外科手术式干预大语言模型前向传播所获得的因果证据,使其将假陈述视为真、反之亦然。总体而言,我们提供的证据表明,在足够规模下,大语言模型以线性方式表征事实陈述的真伪。我们还表明,简单均值差分探针与其他探测技术泛化能力相当,同时识别出在模型输出中更具因果关联的方向。
引用
@article{arxiv.2310.06824,
title = {The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets},
author = {Samuel Marks and Max Tegmark},
journal= {arXiv preprint arXiv:2310.06824},
year = {2024}
}
备注
Conference on Language Modeling, 2024