中文

因果语言模型 detour 提升编码器持续预训练

计算与语言 2026-05-13 v1 人工智能

摘要

当 adapting an encoder to a new domain 时,标准方法是继续使用遮蔽语言模型 (MLM) 进行训练。我们表明,暂时切换为因果语言模型 (CLM) 随后进行短暂的 MLM 衰减可提升下游性能。在现代 biomedical 文本上使用 ModernBERT,CLM detour 在 8 个法语和 11 个英语 biomedical 任务中均优于在相同数据和计算资源下的 MLM baseline,分别提升 1.2-2.8pp 和 0.3-0.8pp。我们探讨了这些提升的原因。我们发现,CLM 的稠密监督对低层 transformer (0-7) 的影响远大于 MLM。在 CLM 期间冻结低层可消除下游收益;冻结中层可保留其效果。表示性变化在 MLM 衰减阶段持续存在,即使 MLM 阶段长度与 CLM 相同,也如此,且随模型容量而比例增长。我们发布了 ModernCamemBERT-bio 和 ModernBERT-bio 作为 Base 和 Large 两种规模的医学生物编码器。

关键词

引用

@article{arxiv.2605.12438,
  title  = {A Causal Language Modeling Detour Improves Encoder Continued Pretraining},
  author = {Rian Touchent and Eric de la Clergerie},
  journal= {arXiv preprint arXiv:2605.12438},
  year   = {2026}
}