中文

BanglaByT5:面向孟加拉语的字节级建模

计算与语言 2025-05-26 v1

摘要

大型语言模型(LLM)在 various natural language processing 任务中取得了显著的成功。然而,大多数 LLM 模型使用传统的分词器(如 BPE 和 SentencePiece),这些分词器无法捕捉像孟加拉语(Bengali)这样在形态学上丰富的语言的细微差异。本文介绍 BanglaByT5,是第一个专为孟加拉语设计的字节级编码器-解码器模型。BanglaByT5 基于Google ByT5架构的小型变体构建,预训练在14GB精选语料库上,语料库融合了高质量的文学作品和报纸文章。通过零样本和监督式评估在生成式和分类任务上,BanglaByT5 显示出竞争性能,超越了多个多语言和更大模型。我们的发现凸显了面向形态学丰富语言的字节级建模的有效性,突显了BanglaByT5作为面向孟加拉语 NLP 的轻量且强大工具的潜力,特别是在资源受限和可扩展的环境中。

关键词

引用

@article{arxiv.2505.17102,
  title  = {BanglaByT5: Byte-Level Modelling for Bangla},
  author = {Pramit Bhattacharyya and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2505.17102},
  year   = {2025}
}