Encoder-Decoder Gemma:通过适配提升质量-效率权衡
计算与语言
2025-04-09 v1 机器学习
摘要
虽然解码器-only 大语言模型(LLM)已展现出惊人的性能,但解码器-编码器模型仍在实际应用中广泛采用,因其推理效率高且编码器表示更丰富。本文研究了一个新问题:如何将预训练的解码器-only LLM 适配为解码器-编码器,以实现两者优势的综合,获得更有利的质量-效率权衡。我们认为,适配不仅使我们能够继承解码器-only LLM 的能力,还能减少相较于从头预训练所需的计算资源。我们严格探索不同的预训练目标及参数初始化/优化技术。通过基于 Gemma 2(2B 和 9B)以及一批新预训练的 mT5 规模模型(最高达 16B)进行大量实验,我们证明适配的有效性以及解码器-编码器 LLM 的优势。在相似的推理预算下,解码器-编码器 LLM 在预训练性能上与其解码器-only 对手相当(常为更好),但在微调后性能显著优于解码器-only 模型。例如,Gemma 2B-2B 在指令微调后相较于 Gemma 2B 高出约 7%。解码器-编码器适配还允许灵活地组合不同规模的模型,Gemma 9B-2B 相较于 Gemma 2B-2B 超过 3%。适配后的编码器表示也在 SuperGLUE 上取得更好结果。我们将发布模型checkpoint 以促进未来研究。
引用
@article{arxiv.2504.06225,
title = {Encoder-Decoder Gemma: Improving the Quality-Efficiency Trade-Off via Adaptation},
author = {Biao Zhang and Fedor Moiseev and Joshua Ainslie and Paul Suganthan and Min Ma and Surya Bhupatiraju and Fede Lebron and Orhan Firat and Armand Joulin and Zhe Dong},
journal= {arXiv preprint arXiv:2504.06225},
year = {2025}
}