中文

MindMerger: 高效提升非英语语言中大语言模型的推理能力

计算与语言 2024-05-28 v1 人工智能

摘要

推理能力对于大语言模型(LLMs)至关重要,但英语与非英语语言之间存在显著差距。为弥合这一差距,一些工作微调LLMs以重新学习非英语语言的推理能力,而另一些工作则用外部模型的输出(如英文翻译文本)替换非英语输入,以规避LLM理解非英语的挑战。然而,这些方法往往未能充分利用LLMs内建的熟练推理和有用的语言理解能力。为了更好地利用LLMs中推理和语言理解的“心智”,我们提出了一种新方法,即MindMerger,它将LLMs与来自多语言模型的外部语言理解能力融合,以提升多语言推理性能。此外,引入了一种两步训练方案,首先训练将外部能力嵌入LLMs,然后训练LLMs对外部能力和内建能力的协作利用。在三个多语言推理数据集和一个语言理解数据集上的实验表明,MindMerger始终优于所有基线,尤其是在低资源语言上。在不更新LLMs参数的情况下,在MGSM数据集上,所有语言和低资源语言的平均准确率分别提高了6.7%和8.0%。

关键词

引用

@article{arxiv.2405.17386,
  title  = {MindMerger: Efficient Boosting LLM Reasoning in non-English Languages},
  author = {Zixian Huang and Wenhao Zhu and Gong Cheng and Lei Li and Fei Yuan},
  journal= {arXiv preprint arXiv:2405.17386},
  year   = {2024}
}