中文

ShishuLM:低注意力Transformer模型的最优高效参数化

计算与语言 2026-04-01 v2 人工智能

摘要

虽然Transformer架构在自然语言处理任务上取得了最先进性能,但这些模型带来了巨大的内存和计算开销。近期研究识别到这些模型在顶层注意力子层中存在显著冗余,为在不牺牲性能的情况下进行优化提供了机会。基于推理时层级修剪和深度依赖计算在语言模型中的研究洞见,我们提出一种高效语言模型架构,称为ShishuLM。通过替换模型顶部的完整解码器层为仅包含MLP的块,可实现生成延迟提升10-60%,吞吐量提升1.3-5倍。进一步共享相邻MLP-only层的参数,可实现内存节省最高达20%,性能下降有限。我们的发现为从预训练角度构建更高效的语言建模架构提供了见解,利用Transformer中信息流的特性。

关键词

引用

@article{arxiv.2510.13860,
  title  = {ShishuLM : Achieving Optimal and Efficient Parameterization with Low Attention Transformer Models},
  author = {Shivanshu Kumar and Gopalakrishnan Srinivasan},
  journal= {arXiv preprint arXiv:2510.13860},
  year   = {2026}
}