中文

为印尼当地语言构建与扩展低资源及代表性不足的平行数据集

计算与语言 2024-04-02 v1

摘要

在印度尼西亚,当地语言在文化中扮演着不可或缺的角色。然而,在自然语言处理(NLP)领域,可用的印尼语言资源仍属于数据有限的类别。这为构建这些语言的 NLP 模型带来了问题。为了弥补这一差距,我们引入了 Bhinneka Korpus,一个包含五种印尼当地语言的多语言平行语料库。我们的目标是增强这些资源的访问和利用,扩大其在该国范围内的覆盖面。我们详细解释了数据集收集过程及相关挑战。此外,由于数据限制,我们使用 IBM Model 1 进行了翻译任务实验。结果表明,每种语言的性能均已显示出适合进一步发展的良好迹象。讨论了词汇变化、平滑效应和跨语言变异性等挑战。我们打算使用针对低资源语言的先进 NLP 技术来评估该语料库,为多语言翻译模型铺平道路。

关键词

引用

@article{arxiv.2404.01009,
  title  = {Constructing and Expanding Low-Resource and Underrepresented Parallel Datasets for Indonesian Local Languages},
  author = {Joanito Agili Lopo and Radius Tanone},
  journal= {arXiv preprint arXiv:2404.01009},
  year   = {2024}
}

备注

Submitted for consideration at the EAMT, 2024. Results pending