大语言模型中的下一个标记预测法则
机器学习
2025-09-03 v3 人工智能
计算与语言
机器学习
摘要
大语言模型(LLMs)已在 various application domains 中广泛应用,但其黑箱特性为理解这些模型如何处理输入数据以进行预测带来了重大挑战。本文引入了一种精确且量化的法则,解释了在预训练大语言模型中,通过中间层学习上下文化标记嵌入的机制。我们的发现表明,从最低层到最高层的每一层都对提高预测准确性贡献相等——这是一种在 diverse array of open-source LLMs 中观察到的普遍现象,无论其体系结构或预训练数据如何。我们展示了这一法则为 LLM 开发和应用提供了新的视角和可操作见解,包括模型扩展、预训练任务和解释。
引用
@article{arxiv.2408.13442,
title = {A Law of Next-Token Prediction in Large Language Models},
author = {Hangfeng He and Weijie J. Su},
journal= {arXiv preprint arXiv:2408.13442},
year = {2025}
}
备注
Transferred for publication to Physical Review E from Physical Review Research (to waive publication charges)