llm-jp-modernbert:在大型日语语料库上训练的具有长上下文长度的 ModernBERT 模型
计算与语言
2025-04-23 v1
摘要
编码器模型如 BERT 广泛用作句子分类和检索任务的预训练主干。然而,与解码器 Transformer 相比,针对大规模语料库和长上下文长度进行编码器模型预训练相对不受关注。本文我们提出 llm-jp-modernbert,这是一个在公开的大型日语语料库上训练的 ModernBERT 模型,上下文长度为 8192 标记。虽然我们的模型在下游任务上未能超越现有基线,但在填充掩码测试评估方面取得了良好结果。我们还通过伪困惑实验分析了上下文长度扩展的效果。此外,我们详细分析了句子嵌入,在训练期间的转换情况进行比较,并与其他现有模型的嵌入进行比较,确认了与相同架构模型相似的趋势。为支持可重复性并促进长上下文 BERT 的发展,我们发布了模型及其训练和评估代码。
引用
@article{arxiv.2504.15544,
title = {llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length},
author = {Issa Sugiura and Kouta Nakayama and Yusuke Oda},
journal= {arXiv preprint arXiv:2504.15544},
year = {2025}
}
备注
9 pages, 5 figures