面向更好的中文指令跟随语言模型:训练数据与评估的影响研究
计算与语言
2023-04-18 v1
摘要
近来,公众为开发具备类似 ChatGPT 能力且低成本的模型作出了重大努力,从而推动了开源对话模型的发展。然而,对这些模型性能的 comprehensive 与深入评估仍然稀缺。在本研究中,我们考察了训练数据因素(包括数量、质量与语言分布)对模型性能的影响。我们的分析基于若干公开可得的高质量指令数据集,以及我们自建的中文多轮对话。我们使用包含九种真实场景的 1000 样本评估集对各类模型进行评估。我们的目标是以定量分析补充人工评估,为开源聊天模型的持续发展提供有价值的见解。此外,为提升模型在中文领域的能力及训练与推理效率,我们扩展了 LLaMA——其开源性能最接近 GPT-3 等专有语言模型——的词表,并在 3.4B 中文词上进行了二次预训练。我们公开了模型、数据与代码。
引用
@article{arxiv.2304.07854,
title = {Towards Better Instruction Following Language Models for Chinese: Investigating the Impact of Training Data and Evaluation},
author = {Yunjie Ji and Yan Gong and Yong Deng and Yiping Peng and Qiang Niu and Baochang Ma and Xiangang Li},
journal= {arXiv preprint arXiv:2304.07854},
year = {2023}
}