中文

从错误中学习使 LLM 成为更好的推理者

计算与语言 2024-04-01 v4 人工智能

摘要

大语言模型(LLMs)近来在解决数学问题上展现出显著的推理能力。为进一步提升其推理能力,本工作探索 LLMs 能否像人类学习过程那样从错误中学习(LEMA)。考虑一个未能解出数学题的人类学生,他会从自己所犯的错误以及该如何改正中学习。模仿这种错误驱动的学习过程,LEMA 在微调 LLMs 时融入了错误-纠正数据对。具体而言,我们首先从多种 LLMs 收集不准确的推理路径,然后采用 GPT-4 作为“纠正器”来识别错误步骤、解释错误原因、纠正错误并生成最终答案。此外,我们应用以纠正为中心的演化策略,有效扩充用于生成纠正数据的问题集。跨越多种 LLMs 与推理任务的实验表明,LEMA 有效改善了仅 CoT 微调。我们进一步的消融实验揭示了 CoT 数据与纠正数据之间非均匀的有效性。这些结果表明 LLMs 通过从错误中学习而提升具有显著潜力。我们的代码、模型和提示已公开于 https://github.com/microsoft/LEMA。

关键词

引用

@article{arxiv.2310.20689,
  title  = {Learning From Mistakes Makes LLM Better Reasoner},
  author = {Shengnan An and Zexiong Ma and Zeqi Lin and Nanning Zheng and Jian-Guang Lou and Weizhu Chen},
  journal= {arXiv preprint arXiv:2310.20689},
  year   = {2024}
}

备注

23 pages, 13 figures, 6 tables