中文

Olapa-MCoT:增强大语言模型的中文数学推理能力

人工智能 2024-01-01 v1 计算与语言 人机交互

摘要

思维链(Chain-of-Thought, CoT)是大语言模型(LLMs)解决推理问题的一种方法。近期,许多研究致力于提升大语言模型的 CoT 能力。在本工作中,我们提出了 Olapa-MCoT,这是一种基于 llama2-13B 预训练语言模型(PLM)进行微调和对齐学习的大语言模型。在对齐训练期间,我们提出了 SimRRHF 算法和错误数据重学习(Incorrect Data Relearning)策略,主要专注于优化 Olapa-MCoT 的中文数学推理能力。实验取得了显著成果,中文数学推理准确率高达 50%,相比 llama2-13B 提升了 36%。此外,英文推理能力的准确率也提升了近 4%。

关键词

引用

@article{arxiv.2312.17535,
  title  = {Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs},
  author = {Shaojie Zhu and Zhaobin Wang and Chengxiang Zhuo and Hui Lu and Bo Hu and Zang Li},
  journal= {arXiv preprint arXiv:2312.17535},
  year   = {2024}
}

备注

10 pages, 1 figures