全新德语编码器:对比 ModernGBERT 与转换式 LLM2Vec 模型
计算与语言
2025-11-04 v2 人工智能
机器学习
摘要
尽管解码器-only LLM 的兴起,编码器仍是高效德语 NLP 和 NLU 场景的关键。本工作在相同的数据与训练约束下,研究两种获取高质量德语编码器的路径:1) 从头训练;2) 通过 LLM2Vec 转换解码器。我们引入两个资源:ModernGBERT (134M, 1B),完全透明的德语编码器,采用 ModernBERT 风格;以及 LL"aMmleinVec (120M, 1B, 7B),采用掩码下一个标记预测训练的解码器转编码器,均经由上下文扩展至 8192 token。 在 SuperGLEBer 上,ModernGBERT 1B 取得平均 0.808 的分数,超越 GBERT Large (+4%) 和七倍更大的转换式 7B 模型 (0.787)。在德语 MTEB 上经监督微调后,ModernGBERT 1B (0.551) 接近转换式 7B 模型 (0.557)。我们发布所有模型、检查点、数据集和完整训练记录,引入编码器适配的 QA-NIAH 评估。总体而言,结果为可操作指导提供了依据:在参数效率和延迟方面重要时,零头训练的编码器占据优势;当预训练解码器已存在且计算资源有限时,转换方法是有效替代方案。ModernGBERT 与 LL"aMmleinVec 包括所有代码、数据和中间检查点,均发布于研究-only RAIL 许可证下。
引用
@article{arxiv.2505.13136,
title = {New Encoders for German Trained from Scratch: Comparing ModernGBERT with Converted LLM2Vec Models},
author = {Julia Wunderle and Anton Ehrmanntraut and Jan Pfister and Fotis Jannidis and Andreas Hotho},
journal= {arXiv preprint arXiv:2505.13136},
year = {2025}
}
备注
under review @LREC