中文

大语言模型Transformer架构的物理模型实现

机器学习 2025-07-23 v2 人工智能 计算与语言 数学物理 math.MP

摘要

2017年Transformer架构的引入标志着自然语言处理领域最显著的进展。Transformer是一种完全依赖注意力机制即可在输入与输出之间建立全局依赖关系的模型架构。然而,我们认为在对Transformer本质及其工作机制的理论理解上仍存在差距。从物理视角来看,28nm制程以下的现代芯片应被视为超出常规统计系统的开放量子系统。基于此,本文构建了一种在标记哈特基空间的Fock 空间上实现大语言模型的物理模型,这些物理模型构成了基于Transformer架构的大语言模型。

关键词

引用

@article{arxiv.2507.13354,
  title  = {Physical models realizing the transformer architecture of large language models},
  author = {Zeqian Chen},
  journal= {arXiv preprint arXiv:2507.13354},
  year   = {2025}
}

备注

6 pages, minor changes, Refs [3, 13, 15] added