词汇嵌入在语言模型训练早期组织语言结构
计算与语言
2025-10-10 v1 人工智能
摘要
大型语言模型(LLM)通过在多个层面上操作输入嵌入向量的几何结构来工作。 那么问题便随之而来:输入词汇表示的几何结构如何组织,以及如何和何时演变为这种结构? 为回答此问题,我们采用表征相似性分析,运行一系列实验,将两个开源模型(Pythia 12B 和 OLMo 7B)的输入嵌入几何结构与输出嵌入几何结构与语义、句法和频率基础指标相关联,随着训练进程的推进。我们的关键发现如下:1)在训练期间,词汇嵌入的几何结构迅速收敛于与语义和句法特征的高度相关性;2)高频词汇和功能词(如“the”、“of”)的嵌入比词汇和低频词汇更快地收敛到其最终向量,而词汇和低频词汇则保留了部分与其随机初始化偏置的对齐。 这些发现帮助我们描绘了输入嵌入如何围绕语言结构组织的动态轨迹,揭示了词汇频率和功能在其中的不同作用。我们的发现激发了对词汇几何如何演变可能促进特定能力提升进行更深入研究的动机。
引用
@article{arxiv.2510.07613,
title = {Vocabulary embeddings organize linguistic structure early in language model training},
author = {Isabel Papadimitriou and Jacob Prince},
journal= {arXiv preprint arXiv:2510.07613},
year = {2025}
}