中文

Aurora:通过指令微调激活Mixtral-8x7B稀疏混合专家模型的中文对话能力

计算与语言 2024-01-02 v2

摘要

现有研究表明,通过利用机器生成的指令遵循数据来微调大型语言模型(LLMs),可以使这些模型在无需人工编写指令的情况下,对新任务展现出令人印象深刻的零样本能力。在本文中,我们系统地研究、预处理并整合了三个中文指令遵循数据集,旨在增强Mixtral-8x7B稀疏混合专家模型的中文对话能力。通过对这一精心处理的数据集进行指令微调,我们成功构建了名为“Aurora”的Mixtral-8x7B稀疏混合专家模型。为了评估Aurora的性能,我们使用了三个广泛认可的基准测试:C-Eval、MMLU和CMMLU。实证研究验证了指令微调对Mixtral-8x7B稀疏混合专家模型的有效性。本文率先在稀疏专家混合模型上执行指令微调,标志着在增强该模型架构能力方面取得了重大突破。我们的代码、数据和模型已在https://github.com/WangRongsheng/Aurora公开。

关键词

引用

@article{arxiv.2312.14557,
  title  = {Aurora:Activating Chinese chat capability for Mixtral-8x7B sparse Mixture-of-Experts through Instruction-Tuning},
  author = {Rongsheng Wang and Haoming Chen and Ruizhe Zhou and Yaofei Duan and Kunyan Cai and Han Ma and Jiaxi Cui and Jian Li and Patrick Cheong-Iao Pang and Yapeng Wang and Tao Tan},
  journal= {arXiv preprint arXiv:2312.14557},
  year   = {2024}
}

备注

10 pages, 2 figures