中文

HalleluBERT:让每一个有意义的标记都能为其分量

计算与语言 2025-10-27 v1

摘要

基于Transformer的模型已推动NLP领域发展,但希伯来语仍缺乏大规模训练的RoBERTa编码器。现有模型如HeBERT、AlephBERT和HeRo受限于语料库规模、词汇表或训练深度。我们提出HalleluBERT,这是一套基于RoBERTa的编码器家族(base和large),使用49.1GB去重的希伯来语网络文本和维基百科训练而成,采用希伯来语特定的字节级BPE词汇表。在命名实体识别和情感分类基准测试上评估,HalleluBERT优于单语言和多语言基线。HalleluBERT为希伯来语设下新的状态量纪,凸显了完全收敛单语言预训练的优势。

关键词

引用

@article{arxiv.2510.21372,
  title  = {HalleluBERT: Let every token that has meaning bear its weight},
  author = {Raphael Scheible-Schmitt},
  journal= {arXiv preprint arXiv:2510.21372},
  year   = {2025}
}