中文

更智能、更优秀、更快速、更长上下文:面向快速、内存高效且长上下文微调与推理的现代双向编码器

计算与语言 2024-12-20 v2 人工智能

摘要

诸如 BERT 之类的仅编码器 Transformer 模型,相较于更大的仅解码器模型,在检索和分类任务上提供了极佳的性能与规模折中。尽管它是众多生产流水线的主力,但自发布以来,BERT 的 Pareto 改进一直有限。在本文中,我们引入了 ModernBERT,将现代模型优化引入仅编码器模型,并代表了对旧编码器的一项重大 Pareto 改进。ModernBERT 在 2 万亿 token 上进行训练,原生支持 8192 序列长度,在包含不同领域(包括代码)的多样分类任务以及单向量和多向量检索的大量评估中展现出 SOTA 结果。除了强大的下游性能外,ModernBERT 也是速度最快、内存效率最高的编码器,专为在常见 GPU 上推理而设计。

关键词

引用

@article{arxiv.2412.13663,
  title  = {Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference},
  author = {Benjamin Warner and Antoine Chaffin and Benjamin Clavié and Orion Weller and Oskar Hallström and Said Taghadouini and Alexis Gallagher and Raja Biswas and Faisal Ladhak and Tom Aarsen and Nathan Cooper and Griffin Adams and Jeremy Howard and Iacopo Poli},
  journal= {arXiv preprint arXiv:2412.13663},
  year   = {2024}
}