中文

推理模式决定一切:无需人类理由即可学习推理

计算与语言 2025-10-15 v1 人工智能

摘要

大型语言模型(LLMs)在广泛采用的SFT+RLVR范式下展现出惊人的推理能力,该范式首先在人工标注的推理轨迹(rationales)上进行监督微调(SFT),以建立初始的推理行为,然后应用基于可验证奖励的强化学习(RLVR)进行优化,而无需金标准理由。在SFT阶段标注高质量理由仍然昂贵且不可行。本文研究在不牺牲推理性能的情况下,如何大幅降低理由标注成本。我们识别出一类广泛存在的问题,称为patterned reasoning tasks,其中推理遵循固定的、在实例之间保持一致的程序策略。尽管实例在领域知识、事实信息或数值等内容上有所不同,但解决方案源自应用相同的推理模式。我们认为,SFT+RLVR在此类任务上的成功主要源于其使模型内化这些推理模式的能力。以数值语义匹配为代表性任务,我们提供了因果和行为证据表明,推理模式而非理由的数量或质量是性能的关键决定因素。基于这些见解,我们提出Pattern-Aware LLMs as Rationale AnnOtators(PARO),一个简单而有效的框架,使LLMs能够生成与任务特定推理模式相匹配的理由,而无需人类理由标注。实验表明,PARO生成的理由可实现与10倍规模的人类理由相当的SFT+RLVR性能。这一结果表明,用仅需对推理模式进行有限人类监督的LLM生成式自动标注,即可取代大规模的人类理由标注。

关键词

引用

@article{arxiv.2510.12643,
  title  = {Reasoning Pattern Matters: Learning to Reason without Human Rationales},
  author = {Chaoxu Pang and Yixuan Cao and Ping Luo},
  journal= {arXiv preprint arXiv:2510.12643},
  year   = {2025}
}

备注

Submitted to Frontiers of Computer Science