通过带翻译指令的多语微调激发大语言模型的翻译能力
计算与语言
2024-04-16 v4
摘要
大规模预训练语言模型(LLMs),如 ChatGPT 与 GPT4,已展现出较强的多语言翻译能力,而无需在平行语料上显式训练。LLMs 如何获得针对不同语言执行翻译指令的能力颇为有趣。本文通过对多语言预训练语言模型 XGLM-7B 进行微调以遵循给定指令执行多语言翻译,给出详细分析。首先,我们表明多语言 LLMs 拥有比此前所展示更强的翻译能力。对某一语言,其性能取决于它与英语的相似度及预训练阶段所用数据量。其次,我们发现 LLMs 执行翻译指令的能力依赖于对翻译指令的理解与不同语言间的对齐。通过多语言微调,LLMs 即便在指令微调阶段未出现的语言对上,也能学会良好地完成翻译任务。
引用
@article{arxiv.2305.15083,
title = {Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions},
author = {Jiahuan Li and Hao Zhou and Shujian Huang and Shanbo Cheng and Jiajun Chen},
journal= {arXiv preprint arXiv:2305.15083},
year = {2024}
}
备注
accepted by Transaction of ACL, pre-MIT version