中文

NorBERTo:基于ModernBERT训练的波特语大型语言模型

计算与语言 2026-05-04 v1 人工智能

摘要

高质量语料库是推动葡萄牙语自然语言处理(NLP)的关键。建立在BERTimbau和Albertina PT-BR等编码器模型基础上,我们介绍NorBERTo,这是一个基于ModernBERT架构的现代编码器,具有长上下文支持和高效注意力机制。NorBERTo是在Aurora-PT上训练的,Aurora-PT是一个新精选的巴西葡萄牙语语料库,包含3310亿个GPT-2 token,来源于多样化的网络来源和现有多语言数据集。我们在语义相似性、文本蕴涵和分类任务上,对NorBERTo进行系统性基准测试,使用标准数据集如ASSIN 2和PLUE。在PLUE上,NorBERTo-large在我们评估的编码器中取得最佳结果,尤其是在MRPC上达到0.9191的F1分数,在RTE上达到0.7689的准确率。在ASSIN 2上,NorBERTo-large在所有被考虑的编码器中实现最高的蕴涵F1(~0.904),尽管Albertina-900M和BERTimbau-large仍然保持优势。据我们所知,Aurora-PT目前是最大的公开可用的单语葡萄牙语语料库,超过了以往资源。NorBERTo为现代、中型编码器提供了解决方案,旨用于实际部署场景:它易于微调、高效可服务,以及作为检索增强生成和其他下游葡萄牙语NLP系统的 backbone。

关键词

引用

@article{arxiv.2605.00086,
  title  = {NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus},
  author = {Enzo S. N. Silva and Pablo B. Costa and Raphael C. Vlasman and Rosimeire P. Costa and Henrique L. P. Silva and Lucas F. A. O. Pellicer and Guilherme Rinaldo and Renato A. Almeida and Darian S. R. Rabbani and Cinthya O. Oestreich and Vinicius F. Caridá},
  journal= {arXiv preprint arXiv:2605.00086},
  year   = {2026}
}

备注

This article has already undergone formal submission, review, acceptance, and publication in the proceedings of PROPOR 2026: Proceedings of the 17th International Conference on Computational Processing of Portuguese, Vol. 1. The published version is available in the ACL Anthology at https://aclanthology.org/2026.propor-1.18/ 11 pages, 9 tables, 2 figures