中文

KwaiYiiMath:技术报告

计算与语言 2023-10-20 v2 人工智能 机器学习

摘要

大语言模型(LLM)近期的进展已展现出处理多种自然语言处理(NLP)下游任务的卓越能力,即便是需要多步推理的数学任务亦然。在本报告中,我们介绍了 KwaiYiiMath,其通过对 KwaiYiiBase1 施加监督微调(SFT)与基于人类反馈的强化学习(RLHF)(包括中英文数学任务),增强了 KwaiYiiBase1 的数学推理能力。同时,我们还构建了一个小规模小学语文数学测试集(命名为 KMath),由 188 道例题组成,用以评估模型所生成解题过程的正确性。实证研究表明,相较于同规模模型,KwaiYiiMath 在 GSM8k、CMath 和 KMath 上均可达到最先进(SOTA)性能。

关键词

引用

@article{arxiv.2310.07488,
  title  = {KwaiYiiMath: Technical Report},
  author = {Jiayi Fu and Lei Lin and Xiaoyang Gao and Pengli Liu and Zhengzong Chen and Zhirui Yang and Shengnan Zhang and Xue Zheng and Yan Li and Yuliang Liu and Xucheng Ye and Yiqiao Liao and Chao Liao and Bin Chen and Chengru Song and Junchen Wan and Zijia Lin and Fuzheng Zhang and Zhongyuan Wang and Di Zhang and Kun Gai},
  journal= {arXiv preprint arXiv:2310.07488},
  year   = {2023}
}

备注

technical report. arXiv admin note: text overlap with arXiv:2306.16636 by other authors