中文

通过带翻译指令的多语微调激发大语言模型的翻译能力

计算与语言 2024-04-16 v4

摘要

大规模预训练语言模型(LLMs),如 ChatGPT 与 GPT4,已展现出较强的多语言翻译能力,而无需在平行语料上显式训练。LLMs 如何获得针对不同语言执行翻译指令的能力颇为有趣。本文通过对多语言预训练语言模型 XGLM-7B 进行微调以遵循给定指令执行多语言翻译,给出详细分析。首先,我们表明多语言 LLMs 拥有比此前所展示更强的翻译能力。对某一语言,其性能取决于它与英语的相似度及预训练阶段所用数据量。其次,我们发现 LLMs 执行翻译指令的能力依赖于对翻译指令的理解与不同语言间的对齐。通过多语言微调,LLMs 即便在指令微调阶段未出现的语言对上,也能学会良好地完成翻译任务。

关键词

引用

@article{arxiv.2305.15083,
  title  = {Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions},
  author = {Jiahuan Li and Hao Zhou and Shujian Huang and Shanbo Cheng and Jiajun Chen},
  journal= {arXiv preprint arXiv:2305.15083},
  year   = {2024}
}

备注

accepted by Transaction of ACL, pre-MIT version