中文

Seq vs Seq:一套配对的编码器与解码器

计算与语言 2026-03-13 v2 信息检索 机器学习

摘要

大型语言模型 (LLM) 社区几乎完全关注解码器-only 语言模型,因为它们更易于用于文本生成。然而,仍有相当一部分社区使用仅编码器模型完成分类或检索等任务。以往的工作为克服必须使用参数、训练技术和数据集不同的模型进行比较的限制,致使比较困难。我们引入了覆盖面积最高的开源 Ettin 套件:一组从 1700 万参数到 10 亿参数的配对仅编码器与仅解码器模型,训练使用最高可达 2 万亿 token 的数据。使用相同的训练配方可为两个模型类别在各自尺度上产生 SOTA 配方,分别超越了 ModernBERT 作为编码器模型,以及 Llama 3.2 和 SmolLM2 作为解码器模型。与以往工作类似,我们发现仅编码器模型在分类和检索任务中表现突出,而解码器模型在生成任务中表现更佳。然而,我们表明,通过持续训练将解码器模型适应编码器任务(反之亦然)的效果远不如仅使用相反目标(即 4 亿参数编码器在 MNLI 上超越 10 亿参数解码器,反之亦然)。我们开源了本研究的所有制品,包括训练数据、按 checkpoint 分段的训练顺序,以及 200 多个 checkpoint,以便未来工作分析或延伸训练的所有方面。

关键词

引用

@article{arxiv.2507.11412,
  title  = {Seq vs Seq: An Open Suite of Paired Encoders and Decoders},
  author = {Orion Weller and Kathryn Ricci and Marc Marone and Antoine Chaffin and Dawn Lawrie and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2507.11412},
  year   = {2026}
}

备注

Accepted to ICLR'26