中文

全新德语编码器:对比 ModernGBERT 与转换式 LLM2Vec 模型

计算与语言 2025-11-04 v2 人工智能 机器学习

摘要

尽管解码器-only LLM 的兴起,编码器仍是高效德语 NLP 和 NLU 场景的关键。本工作在相同的数据与训练约束下,研究两种获取高质量德语编码器的路径:1) 从头训练;2) 通过 LLM2Vec 转换解码器。我们引入两个资源:ModernGBERT (134M, 1B),完全透明的德语编码器,采用 ModernBERT 风格;以及 LL"aMmleinVec (120M, 1B, 7B),采用掩码下一个标记预测训练的解码器转编码器,均经由上下文扩展至 8192 token。 在 SuperGLEBer 上,ModernGBERT 1B 取得平均 0.808 的分数,超越 GBERT Large (+4%) 和七倍更大的转换式 7B 模型 (0.787)。在德语 MTEB 上经监督微调后,ModernGBERT 1B (0.551) 接近转换式 7B 模型 (0.557)。我们发布所有模型、检查点、数据集和完整训练记录,引入编码器适配的 QA-NIAH 评估。总体而言,结果为可操作指导提供了依据:在参数效率和延迟方面重要时,零头训练的编码器占据优势;当预训练解码器已存在且计算资源有限时,转换方法是有效替代方案。ModernGBERT 与 LL"aMmleinVec 包括所有代码、数据和中间检查点,均发布于研究-only RAIL 许可证下。

关键词

引用

@article{arxiv.2505.13136,
  title  = {New Encoders for German Trained from Scratch: Comparing ModernGBERT with Converted LLM2Vec Models},
  author = {Julia Wunderle and Anton Ehrmanntraut and Jan Pfister and Fotis Jannidis and Andreas Hotho},
  journal= {arXiv preprint arXiv:2505.13136},
  year   = {2025}
}

备注

under review @LREC