中文

波兰语言长文本编码器模型

计算与语言 2026-03-13 v1

摘要

尽管解码器-only 大型语言模型 (LLM) 最近在 NLP 领域占据主导地位,但仅包含解码器的架构仍是判别任务中成本效益高且参数效率高的标准。然而,经典编码器如 BERT 受限于短文本窗口,难以处理长文档。在本文中,我们针对波兰语提出了这一限制的解决方案,引入了一种能够处理最长多 8192 个 token 的高质量波兰语模型。该模型通过两阶段训练程序实现,包括位置编码适配和完整参数连续预训练。此外,我们还提出了通过知识蒸馏训练的压缩模型变体。对模型进行了在 25 项任务上的评估,包括 KLEJ 基准、全新的金融任务套组 (FinBench),以及其他需要长文档理解的分类和回归任务。结果表明,我们的模型在波兰语和多语言模型中实现了最佳平均性能,在长文本任务中显著优于竞争性解决方案,同时在短文本上的质量保持相当。

关键词

引用

@article{arxiv.2603.12191,
  title  = {Long-Context Encoder Models for Polish Language Understanding},
  author = {Sławomir Dadas and Rafał Poświata and Marek Kozłowski and Małgorzata Grębowiec and Michał Perełkiewicz and Paweł Klimiuk and Przemysław Boruta},
  journal= {arXiv preprint arXiv:2603.12191},
  year   = {2026}
}