NusaBERT:教会IndoBERT实现多语言和多文化
计算与语言
2024-03-05 v1
摘要
印度尼西亚的语言景观极其多样,包含700多种语言和方言,使其成为世界上语言最丰富的国家之一。这种多样性,加上广泛使用的语码转换和低资源地区语言的存在,给现代预训练语言模型带来了独特的挑战。为了应对这些挑战,我们开发了NusaBERT,它在IndoBERT的基础上通过扩展词汇表并利用包含地区语言和方言的多样化多语言语料库进行构建。通过在一系列基准测试中的严格评估,NusaBERT在涉及印度尼西亚多种语言的任务中展示了最先进的性能,为未来针对低资源语言的自然语言理解研究铺平了道路。
引用
@article{arxiv.2403.01817,
title = {NusaBERT: Teaching IndoBERT to be Multilingual and Multicultural},
author = {Wilson Wongso and David Samuel Setiawan and Steven Limcorn and Ananto Joyoadikusumo},
journal= {arXiv preprint arXiv:2403.01817},
year = {2024}
}