中文

字典链提示激发大语言模型的翻译能力

计算与语言 2024-08-20 v6

摘要

大语言模型(LLMs)即使在无平行数据训练的情况下,也在多语言神经机器翻译(MNMT)中展现出令人惊讶的良好性能。然而,尽管训练数据量巨大,它们仍难以翻译罕见词,尤其是低资源语言。更糟糕的是,在 LLMs 上针对低资源语言检索相关示例进行上下文学习通常是不现实的,这限制了 LLMs 用于翻译的实际应用——我们应如何缓解该问题?为此,我们提出一种新方法 CoD,它通过为输入词的一个子集提供多语言字典链,以先验知识增强 LLMs,从而激发其翻译能力。大量实验表明,在 FLORES-200 完整 devtest 集上,用 CoD 增强 ChatGPT 可为 MNMT 带来高达 13 倍 chrF++ 分数的巨大提升(从英文到西里尔字母书写的塞尔维亚语由 3.08 提升至 42.63)。我们进一步证明了多语言字典链的重要性,以及 CoD 相对于少样本示例在低资源语言上的优越性。

关键词

引用

@article{arxiv.2305.06575,
  title  = {Chain-of-Dictionary Prompting Elicits Translation in Large Language Models},
  author = {Hongyuan Lu and Haoran Yang and Haoyang Huang and Dongdong Zhang and Wai Lam and Furu Wei},
  journal= {arXiv preprint arXiv:2305.06575},
  year   = {2024}
}