中文

LLM 评论员帮助捕捉数学中的错误:面向更好数学验证器的自然语言反馈

计算与语言 2024-10-21 v4

摘要

近期进展表明,数学验证器通过验证由策略模型生成的解答的正确性,在数学推理任务中取得了成功。然而,现有验证器使用二元分类标签进行训练,这些标签对模型准确评估解答的信息不足。在此基础上,本文引入逐步自然语言反馈作为理由标签,即每个步骤的正确性及详细解释。我们提出 Math-Minos,一种结合自动生成的训练数据和两阶段训练范式的人工智能增强验证器,以实现有效训练和高效推理。我们的实验表明,少量自然语言反馈即可显著提升验证器在验证和强化学习方面的性能。我们已发布代码和数据供进一步探索。

关键词

引用

@article{arxiv.2406.14024,
  title  = {LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback},
  author = {Bofei Gao and Zefan Cai and Runxin Xu and Peiyi Wang and Ce Zheng and Runji Lin and Keming Lu and Dayiheng Liu and Chang Zhou and Wen Xiao and Junjie Hu and Tianyu Liu and Baobao Chang},
  journal= {arXiv preprint arXiv:2406.14024},
  year   = {2024}
}

备注

15 pages