中文

解码器-编码器大语言模型:从规模化视角重新审视

计算与语言 2025-10-31 v1

摘要

最近的大型语言模型 (LLM) 研究发生了从编码器-解码器建模向当下主导的解码器-only 建模的快速转变。然而,这种快速转变缺乏特别从规模化视角进行的严格比较,引发了编码器-解码器模型潜力可能被忽视的担忧。为填补这一空白,我们重新审视了编码器-解码器大语言模型 (RedLLM),通过引入来自解码器-only 大语言模型 (DecLLM) 的最新技术进行增强。我们在不同模型规模(从约 1.5 亿到约 80 亿)下,对比了使用前缀语言模型 (LM) 预训练的 RedLLM 与使用因果 LM 预训练的 DecLLM。实验采用 FLAN 进行指令调优,结果表明 RedLLM 在规模化方面表现出引人注目的数值性能。虽然 DecLLM 在预训练期间总体上更具计算效率,但 RedLLM 在规模化和上下文长度外推能力方面表现相当。经过指令调优后,RedLLM 在各种下游任务上实现了相当甚至更好的结果,同时享有显著更好的推理效率。我们希望我们的发现能够激发更多人力去重新审视 RedLLM,释放其开发强大且高效 LLM 的潜力。

关键词

引用

@article{arxiv.2510.26622,
  title  = {Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model},
  author = {Biao Zhang and Yong Cheng and Siamak Shakeri and Xinyi Wang and Min Ma and Orhan Firat},
  journal= {arXiv preprint arXiv:2510.26622},
  year   = {2025}
}

备注

The scaling study inspiring T5Gemma