DunbaaBERT:从牺牲到语义
计算与语言
2026-05-27 v1
摘要
大型语言模型已在诸多 NLP 任务上取得显著性能,但乌尔都语仍因资源有限和评估setting碎片化而相对不被探索。为填补这一差距,我们引入 DunbaaBERT,这是一套在 17GB 乌尔都语语料上进行去重复处理后,以 Byte-BPE 词汇表(包含 32k、52k 和 96k 个 token)从头训练的乌尔都 RoBERTa-base 模型系列。我们在覆盖语言可接受性、新闻分类、侮辱语言检测和情感分析的内在和下游乌尔都 NLP 基准测试上评估 DunbaaBERT,分析词汇表大小对性能和效率权衡的影响。在所有基准测试中,DunbaaBERT 变体均在强大的多语言基准之上取得有竞争力的性能,同时始终保持有利的效率权衡。有趣的是,更大的词汇表并不一致地提高下游有效性,DunbaaBERT 反复提供最强的整体效率 profile。总体而言,我们的结果表明,精心策划的乌尔都特定编码器模型即便在较小的模型和训练规模下也能保持高度竞争力。所有模型均在 MIT 许可下发布。
引用
@article{arxiv.2605.26935,
title = {DunbaaBERT: From Sacrifice to Semantics},
author = {Iffat Maab and Waleed Jamil and Raphael Schmitt},
journal= {arXiv preprint arXiv:2605.26935},
year = {2026}
}