中文

Token 嵌入违反流形假设

计算与语言 2025-10-24 v3 人工智能

摘要

要充分理解大型语言模型(LLM)的行为,就必须把握其输入 token 空间的结构。如果该空间不同于我们的假设,那么我们对 LLM 的理解和结论很可能不准确。我们既通过实证方法又通过理论方法阐明了 token 嵌入的结构。我们提出了一种新型统计检验,假设围绕每个 token 的邻域具有相对平坦且光滑的结构作为原假设。若无法拒绝原假设则缺乏信息,但若在特定 token ψ\psi 处拒绝原假设,则表明 token 子空间在 ψ\psi 邻域 B(ψ)B(\psi) 中存在不规则结构。假设的原假设是一种称为光滑纤维束(smooth fiber bundle)的流形边界的推广(可分为两个空间范畴——小半径和大半径),因此我们将新的假设检验称为“纤维束假设”。通过对多个开源 LLM 进行该检验,每个模型都有其独特的 token 嵌入,我们发现原假设经常被拒绝,因此证据表明 token 子空间既不是纤维束,也不是流形。根据我们的发现,当 LLM 面对两个语义等效的提示词时,如果其中一个提示词包含我们检验所暗示的 token,该提示词的响应很可能表现出比另一个提示词更少的稳定性。

关键词

引用

@article{arxiv.2504.01002,
  title  = {Token embeddings violate the manifold hypothesis},
  author = {Michael Robinson and Sourya Dey and Tony Chiang},
  journal= {arXiv preprint arXiv:2504.01002},
  year   = {2025}
}

备注

30 pages, 9 figures, 10 tables