中文

IndoNLG:评估印尼语自然语言生成的基准与资源

计算与语言 2021-10-12 v3

摘要

自然语言生成(NLG)基准为衡量进展和开发更好的NLG系统提供了重要途径。遗憾的是,缺乏公开可用的低资源语言NLG基准,为构建在有限数据语言上表现良好的NLG系统带来了严峻障碍。本文介绍IndoNLG,首个用于衡量印度尼西亚三种低资源但广泛使用的语言——印尼语、爪哇语和巽他语——自然语言生成(NLG)进展的基准。这些语言总计由超过1亿母语者使用,因而构成了当今NLG系统的重要用例。具体而言,IndoNLG涵盖六项任务:摘要、问答、闲聊,以及三对不同对的机器翻译(MT)任务。我们整理了一个干净的印尼语、巽他语和爪哇语数据集预训练语料Indo4B-Plus,用于预训练我们的模型:IndoBART和IndoGPT。我们表明,尽管仅使用更大多语言模型mBART-LARGE(Liu et al., 2020)五分之一的参数,IndoBART和IndoGPT在所有任务上均取得了有竞争力的性能。该发现强调了在紧密相关的本地语言上预训练对于像爪哇语和巽他语这类极低资源语言实现更高效学习和更快推断的重要性。

关键词

引用

@article{arxiv.2104.08200,
  title  = {IndoNLG: Benchmark and Resources for Evaluating Indonesian Natural Language Generation},
  author = {Samuel Cahyawijaya and Genta Indra Winata and Bryan Wilie and Karissa Vincentio and Xiaohong Li and Adhiguna Kuncoro and Sebastian Ruder and Zhi Yuan Lim and Syafri Bahar and Masayu Leylia Khodra and Ayu Purwarianti and Pascale Fung},
  journal= {arXiv preprint arXiv:2104.08200},
  year   = {2021}
}

备注

Accepted in EMNLP 2021, 10 pages