中文

AraModernBERT:阿拉伯语的转词化初始化与长上下文编码建模

计算与语言 2026-03-13 v2 人工智能

摘要

编码器-only transformer 模型在判别式 NLP 任务中仍广泛使用,但近期的架构进步主要聚焦于英语。在本工作中,我们提出 AraModernBERT,将 ModernBERT 编码器架构适用于阿拉伯语,并研究转词化嵌入初始化和原生长上下文建模(最长达 8192 token)的影响。我们表明,转词化是阿拉伯语语言建模的必需品,相较于非转词化初始化,在掩码语言建模性能上显著提升。我们进一步证明,AraModernBERT 支持稳定有效的长上下文建模,在扩展序列长度方面实现改进的内在语言建模性能。下游评估涵盖阿拉伯语自然语言理解任务,包括推理、仇恨语言检测、问题-问题相似性和命名实体识别,确认了对判别式和序列标注设置的强大迁移。我们的结果凸显了适应现代编码器架构用于阿拉伯语及其他使用阿拉伯字母衍生脚本的语言的实用考虑。

关键词

引用

@article{arxiv.2603.09982,
  title  = {AraModernBERT: Transtokenized Initialization and Long-Context Encoder Modeling for Arabic},
  author = {Omar Elshehy and Omer Nacar and Abdelbasset Djamai and Muhammed Ragab and Khloud Al Jallad and Mona Abdelazim},
  journal= {arXiv preprint arXiv:2603.09982},
  year   = {2026}
}

备注

9 pages, 1 figure. Accepted at AbjadNLP Workshop, EACL 2026