HRM-Text:超越规模化的高效预训练
计算与语言
2026-05-21 v1
摘要
当前的大语言模型预训练范式依赖海量计算和互联网规模的原始文本,构成了基础研究的重大障碍。相比之下,生物系统通过多时间尺度处理展现出高度样本高效的学习,如前额-顶联络的功能组织。以此为灵感,我们引入HRM-Text,用层次化循环模型(HRM)取代标准Transformer,将计算解耦分为慢演化的战略层和快速演化的执行层。为稳定语言建模中的深层循环,我们引入MagicNorm和深度信用分配预热。此外,我们不采用标准的原始文本预训练,而是仅使用指令-响应对进行任务完成目标的训练。作为从零开始训练仅需400亿个唯一token和1500美元预算即可获得60.7% MMLU、81.9% ARC-C、82.2% DROP、84.5% GSM8K和56.2% MATH的实验结果,证明了高效预训练的可行性。尽管使用了约100-900倍更少的训练token和96-432倍更少的估计计算量,HRM-Text的表现与2-7B参数开放模型相当。这些结果表明,架构与目标的协同设计可以根本性地降低计算-性能比率,使从零开始的预训练变得可及于更广泛的研究社区。
引用
@article{arxiv.2605.20613,
title = {HRM-Text: Efficient Pretraining Beyond Scaling},
author = {Guan Wang and Changling Liu and Chenyu Wang and Cai Zhou and Yuhao Sun and Yifei Wu and Shuai Zhen and Luca Scimeca and Yasin Abbasi Yadkori},
journal= {arXiv preprint arXiv:2605.20613},
year = {2026}
}