中文

语言模型中线性表示与预训练数据频率的关系

计算与语言 2025-04-18 v1 人工智能

摘要

预训练数据对语言模型(LM)的行为和质量具有直接影响, 但我们仅了解其最基本的原理。虽然大多数工作关注预训练数据对下游任务行为的影响, 但本文探讨了其与 LM 表示之间的关系。先前的工作发现, 在语言模型中, 某些概念在表示中被编码为`线性',但什么因素导致这些表示形成?我们研究了预训练术语频率与模型对事实关系的线性表示之间的关系。我们发现, 线性表示的形成与预训练术语频率密切相关; 具体来说, 对于主语-关系-客体事实三元组, 主语-客体共现频率和关系的 in-context 学习准确率与线性表示高度相关。这种情况适用于所有预训练阶段。在 OLMo-7B 和 GPT-J 中, 我们发现当主语和客体在关系中至少分别出现 1k 和 2k 次时, 线性表示就会形成(但并非唯一地), 且无论这些出现在预训练期间发生时都如此。最后, 我们在 fully 训练的 LM 中对线性表示质量的测量上训练回归模型, 可预测术语在预训练中出现的频率。我们的模型即使在来自不同模型且具有不同预训练数据集的输入上也能实现低误差, 为估计闭合数据模型不可知训练数据的属性提供了一种新方法。我们得出结论, 语言模型中线性表示的强度包含关于模型预训练语料库的信号, 可能为控制和改进模型行为提供新的途径: 特别是, 通过操作模型的训练数据以满足特定频率阈值来实现这一点。

关键词

引用

@article{arxiv.2504.12459,
  title  = {On Linear Representations and Pretraining Data Frequency in Language Models},
  author = {Jack Merullo and Noah A. Smith and Sarah Wiegreffe and Yanai Elazar},
  journal= {arXiv preprint arXiv:2504.12459},
  year   = {2025}
}

备注

ICLR 2025