中文

面向未见语言的大型语言模型教学

计算与语言 2024-06-14 v2

摘要

现有的大型语言模型在支持众多低资源语言方面存在困难,尤其是对于目前没有任何大型语言模型支持的极低资源语言,因为缺乏有效参数更新所需的最少训练数据。因此,我们研究了大型语言模型是否仅通过提示就能在现场学习新语言。为此,我们收集了一个针对著忘语(Zhuang)的研究套件,该语言目前没有被任何大型语言模型支持。我们引入DiPMT++,这是一种通过原地学习适应大型语言模型以应对未见语言的框架。仅使用一个词典和5000句平行句子,DiPMT++显著提升了GPT-4进行中文到著忘语翻译时从0 BLEU到16 BLEU的性能,并实现了著忘语到中文翻译的32 BLEU。我们还在另一种未见语言——卡拉曼加(Kalamang)上验证了该框架的有效性。此外,我们展示了DiPMT++在帮助人类翻译完全未知语言方面的实际用途,这有助于语言多样性的保存。

关键词

引用

@article{arxiv.2402.19167,
  title  = {Teaching Large Language Models an Unseen Language on the Fly},
  author = {Chen Zhang and Xiao Liu and Jiuheng Lin and Yansong Feng},
  journal= {arXiv preprint arXiv:2402.19167},
  year   = {2024}
}

备注

ACL 2024 https://github.com/luciusssss/ZhuangBench