MiniGPT:从原理重建 GPT
计算与语言
2026-05-19 v1 机器学习
摘要
本文提出了 MiniGPT,这是一个在 PyTorch 中从零实现的 GPT 风格自回归语言模型。旨在在研究 nanoGPT 的设计后,从头重建核心 GPT 管道,同时保持模型和训练代码在单个笔记本中独立编写。MiniGPT 实现了 token 和位置嵌入、因果多头自注意力、预 LayerNorm Transformer 块、残差连接、前馈 MLP 层、下一个 token 交叉熵训练(教师强制)、验证跟踪、检查点选择以及自回归文本生成。本文在 Tiny Shakespeare 数据集上对该实现进行评估,使用字符级分词。一个基线 0.83M 参数模型在 3000 次训练迭代后达到 1.7236 的验证损失。一个更强的 10.77M 参数配置,使用更大的上下文长度和改进的训练设置,达到最佳验证损失 1.4780,并生成具有可识别莎丁狮式对话结构的文本。MiniGPT 不引入新的语言模型架构。相反,它记录了从原始文本到训练字符级生成的清晰可复现的实现路径,包括设计选择、训练行为、生成质量和实际限制。
关键词
引用
@article{arxiv.2605.17398,
title = {MiniGPT: Rebuilding GPT from First Principles},
author = {Jibin Joseph},
journal= {arXiv preprint arXiv:2605.17398},
year = {2026}
}
备注
13 pages, 2 figures