中文

通过语言对齐将大语言模型外推至非英语语言

计算与语言 2023-10-10 v2

摘要

现有大语言模型因训练数据的不平衡,在不同语言间表现出能力差异。其在英语任务上的表现通常强于其他语言任务。本文通过构建跨语言语义对齐,赋予预训练 LLMs 在非英语语言上的能力。我们首先通过对 LLaMA 进行跨语言指令微调(CoIT),即使用翻译任务数据与跨语言通用任务数据对其进行微调以获得跨语言模型(x-LLaMAs),从而针对单个语言,并推导出潜在的缩放定律以考察可扩展翻译数据带来的优势。随后我们利用混合资源进行多语言指令微调(MuIT)以构建多语言 m-LLaMA。我们还说明了如何在资源受限设定下利用缩放定律优化数据分配。在跨语言基准 XQUAD 与 MLQA 上的实验结果表明,x-LLaMAs 在六种非英语语言上平均超越英语指令微调对应模型(Alpaca)27.83%。在翻译数据集 Flores-101 上的评估显示,x-LLaMAs 平均优于先前基于 LLaMA 的模型 18.89%。令人鼓舞的是,m-LLaMA 在单个语言上取得了与 x-LLaMAs 可比的性能,并展现出遵循多语言指令的能力。对响应内容与表示空间的进一步分析揭示了 m-LLaMA 中间层中多语言语义空间的对齐。

关键词

引用

@article{arxiv.2308.04948,
  title  = {Extrapolating Large Language Models to Non-English by Aligning Languages},
  author = {Wenhao Zhu and Yunzhe Lv and Qingxiu Dong and Fei Yuan and Jingjing Xu and Shujian Huang and Lingpeng Kong and Jiajun Chen and Lei Li},
  journal= {arXiv preprint arXiv:2308.04948},
  year   = {2023}
}