让我们逐步自我生成:一种面向大语言模型自动推理的课程学习方法
计算与语言
2025-06-02 v4
摘要
尽管思维链(Chain of Thought, CoT)提示方法显著巩固了大语言模型(LLMs)的推理能力,但它们仍面临需要大量人工努力或性能有待提高的局限性。现有的努力集中在弥合这些差距上;然而,这些方法要么依赖于外部数据且无法完全消除人工努力,要么在有效引导LLMs生成高质量示例性提示方面存在不足。为了解决上述缺陷,我们提出了一种名为\textbf{LBS3}的新型自动推理提示方法,其灵感来源于更能反映人类学习习惯的课程学习。具体来说,LBS3首先引导LLMs回忆与目标查询相关的、从易到难的代理查询。随后,它调用一种渐进式策略,利用源于简单代理查询的示例性提示来指导LLMs解决困难代理查询,从而确保代理解决方案的高质量。最后,我们在各种推理密集型任务上,使用不同的开源和闭源LLMs进行了广泛实验,结果表明,与SOTA基线相比,LBS3实现了极具竞争力的性能。
引用
@article{arxiv.2410.21728,
title = {Let's Be Self-generated via Step by Step: A Curriculum Learning Approach to Automated Reasoning with Large Language Models},
author = {Kangyang Luo and Zichen Ding and Zhenmin Weng and Lingfeng Qiao and Meng Zhao and Xiang Li and Di Yin and Jinlong Shu},
journal= {arXiv preprint arXiv:2410.21728},
year = {2025}
}
备注
Accepted by ACL2025(Findings)