全都在 [MASK] 中:简单指令微调使类 BERT 的掩码语言模型成为生成式分类器
计算与语言
2025-02-11 v2 人工智能
摘要
虽然编码器模型如 BERT 和 ModernBERT 在实际 NLP 应用中屡见不鲜,但其传统依赖于任务特定的分类头,这会限制其适用性,相较于解码器基准大语言模型(LLM)。本文介绍了 ModernBERT-Large-Instruct,一个 0.4B 参数的编码器模型,利用其掩码语言建模(MLM)头进行生成式分类。我们的做法采用意图简单的训练循环和推理机制,无需重处理、无需复杂提示或架构修改。ModernBERT-Large-Instruct 在分类和知识类任务上表现出强大的零样性能, outperforming 相似规模的 LLM 在 MMLU 上,并以 60% 的参数实现了 Llama3-1B MMLU 性能的 93%。我们还展示了,在精细调优后,利用 MLM 头的生成式方法在多样化 NLU 任务上匹配甚至超越传统分类头方法。这一能力特别出现在训练数据为当代、多样化数据混合的模型上,训练数据量较小、数据混合性较差的模型表现明显较差。虽然这些结果仍属初步,但本文的工作表明,使用原始的生成式掩码语言建模头而非传统任务特定头用于下游任务的潜力值得进一步探索,为未来的改进指明了许多方向。
引用
@article{arxiv.2502.03793,
title = {It's All in The [MASK]: Simple Instruction-Tuning Enables BERT-like Masked Language Models As Generative Classifiers},
author = {Benjamin Clavié and Nathan Cooper and Benjamin Warner},
journal= {arXiv preprint arXiv:2502.03793},
year = {2025}
}