大型语言模型的记号空间结构
微分几何
2024-10-14 v1 人工智能
摘要
大型语言模型通过将言语片段(记号)拟合到高维环境潜在空间上来编码自然语言中存在的相关结构,然后在该空间上进行操作。我们断言,为了建立对大型语言模型行为与局限性的基础性、从原理出发的理解,关键在于理解该记号子空间的拓扑与几何结构。在本文中,我们提出了用于估计记号子空间维数和 Ricci 曲率的估计器,并将其应用于三种开源中等规模的大型语言模型:GPT2、LLEMMA7B 和 MISTRAL7B。在这三种模型中,利用这些测量,我们发现记号子空间不是流形,而是分层流形。在每个单独的层次上,Ricci 曲率显著为负。我们 additionally 发现维数和曲率与模型的生成流畅性相关,这表明这些发现对模型行为具有启示意义。
引用
@article{arxiv.2410.08993,
title = {The structure of the token space for large language models},
author = {Michael Robinson and Sourya Dey and Shauna Sweet},
journal= {arXiv preprint arXiv:2410.08993},
year = {2024}
}
备注
33 pages, 22 figures