为拉脱维亚语预训练和基准测试现代编码器
计算与语言
2026-03-17 v1
摘要
编码器-only transformer 仍是实用 NLP 任务的关键。虽然最近的多语言模型进展提升了跨语言能力,但低资源语言如拉脱维亚语在预训练语料中仍显得不足,目前几乎没有单语拉脱维亚语编码器。我们通过在RoBERTa、DeBERTaV3和 ModernBERT 架构上预训练一套拉脱维亚语专用编码器,包括长上下文变体,并在多样化的拉脱维亚语诊断和语言学基准上对其进行评估。我们的模型在与现有单语和多语言编码器竞争的同时,受益于最新的架构和效率进步。我们的最佳模型 lv-deberta-base(1.11亿参数)实现了最佳整体性能,超越了更大的多语言基线和之前的拉脱维亚语专用编码器。我们发布的所有预训练模型和评估资源旨在支持拉脱维亚语 NLP 进一步的研究和实际应用。
引用
@article{arxiv.2603.15005,
title = {Pretraining and Benchmarking Modern Encoders for Latvian},
author = {Arturs Znotins},
journal= {arXiv preprint arXiv:2603.15005},
year = {2026}
}