中文

MAmmoTH2:从网络扩展指令

计算与语言 2024-05-24 v4

摘要

指令微调提升了大型语言模型(LLMs)的推理能力,其中数据质量和可扩展性是关键因素。大多数指令微调数据来自人工众包或GPT-4蒸馏。我们提出了一种范式,从预训练网络语料中高效获取1000万条自然存在的指令数据,以增强LLM推理。我们的方法包括(1)召回相关文档,(2)提取指令-响应对,(3)使用开源LLM精炼提取的对。在此数据集上微调基础LLM,我们构建了MAmmoTH2模型,显著提升了推理基准的性能。值得注意的是,MAmmoTH2-7B(Mistral)在MATH上的性能从11%提升到36.7%,在GSM8K上从36%提升到68.4%,且未在任何领域内数据上训练。进一步在公共指令微调数据集上训练MAmmoTH2得到MAmmoTH2-Plus,在多个推理和聊天机器人基准上达到了最先进的性能。我们的工作展示了如何在不进行昂贵的人工标注或GPT-4蒸馏的情况下获取大规模、高质量的指令数据,为构建更好的指令微调数据提供了新范式。

关键词

引用

@article{arxiv.2405.03548,
  title  = {MAmmoTH2: Scaling Instructions from the Web},
  author = {Xiang Yue and Tuney Zheng and Ge Zhang and Wenhu Chen},
  journal= {arXiv preprint arXiv:2405.03548},
  year   = {2024}
}