中文

使用现成大型语言模型为严重资源匮乏语言生成高质量数据到文本

计算与语言 2024-02-20 v1

摘要

对于严重资源匮乏的语言,NLP方法的性能目前无法期望与资源丰富语言的NLP方法的最先进水平相匹配。我们通过爱尔兰语、威尔士语、布列塔尼语和马耳他语的数据到文本生成示例,探索预训练大型语言模型(LLM)在多大程度上可以弥合这一差距。我们在多种场景下测试了LLM在这些资源匮乏语言和英语上的表现。我们发现,LLM在自动评估和人工评估中均以显著优势轻松地为资源匮乏语言设立了新的最先进水平。对于所有语言,人工评估显示我们最佳系统的表现与人类相当,但BLEU分数与英语相比大幅下降,这使人们对这一指标在评估非任务特定系统时的适用性产生怀疑。总体而言,我们的结果证明了LLM在弥合资源匮乏语言性能差距方面的巨大潜力。

关键词

引用

@article{arxiv.2402.12267,
  title  = {High-quality Data-to-Text Generation for Severely Under-Resourced Languages with Out-of-the-box Large Language Models},
  author = {Michela Lorandi and Anya Belz},
  journal= {arXiv preprint arXiv:2402.12267},
  year   = {2024}
}