中文

LexC-Gen:利用大语言模型和双语词典为极低资源语言生成数据

计算与语言 2024-10-29 v3 人工智能 机器学习

摘要

低资源语言中的数据稀缺问题可以通过利用双语词典将高资源语言中标记的任务数据进行词对词翻译来解决。然而,双语词典往往与任务数据的词汇重叠有限,导致翻译覆盖率和词典利用率低下。我们提出了词典条件化数据生成方法 LexC-Gen,该方法能够大规模生成低资源语言的分类任务数据。具体而言,LexC-Gen 首先利用双语词典中的高资源语言词汇生成与词典兼容的任务数据,然后通过词翻译将其利用双语词典翻译为低资源语言。在 17 种极低资源语言上的实验表明,LexC-Gen 生成的数据与专家翻译的金标数据具有竞争力,并且在情感分析和主题分类任务上,平均比现有的基于词典的词翻译方法分别提升了 5.6 和 8.9 个点。通过消融实验,我们证明了以双语词典为条件是 LexC-Gen 的关键组件。LexC-Gen 有望成为一种解决方案,以缩小开源多语言模型(如 BLOOMZ 和 Aya-101)与最先进商业模型(如 GPT-4o)在低资源语言任务上的性能差距。

关键词

引用

@article{arxiv.2402.14086,
  title  = {LexC-Gen: Generating Data for Extremely Low-Resource Languages with Large Language Models and Bilingual Lexicons},
  author = {Zheng-Xin Yong and Cristina Menghini and Stephen H. Bach},
  journal= {arXiv preprint arXiv:2402.14086},
  year   = {2024}
}

备注

EMNLP Findings 2024