中文

从对比中学习:从多样化搜索轨迹中合成推理路径

人工智能 2026-04-14 v1 计算与语言

摘要

蒙特卡洛树搜索(MCTS)已被广泛用于自动化推理数据探索,但当前的监督提取方法仍然效率低下。标准方法仅保留单一最高奖励轨迹,丢弃了众多探索路径中存在的比较信号。在此,我们引入了**对比推理路径合成(CRPS)**,这是一个将监督提取从过滤过程转变为合成过程的框架。CRPS使用结构化的反思过程来分析高质量和低质量搜索轨迹之间的差异,提取关于策略转折点和局部失败模式的显式信息。这些见解指导了推理链的合成,这些推理链在避免已识别陷阱的同时融入了成功模式。我们通过实验表明,仅用60K个CRPS合成示例微调的模型,其性能达到或超过了在590K个源自标准拒绝采样的示例上训练的基线,数据集大小减少了20倍。此外,CRPS提高了在域外基准上的泛化能力,表明从成功与失败的对比中学习比仅从成功中学习能产生更具可迁移性的推理能力。

关键词

引用

@article{arxiv.2604.11365,
  title  = {Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories},
  author = {Peiyang Liu and Zhirui Chen and Xi Wang and Di Liang and Youru Li and Zhi Cai and Wei Ye},
  journal= {arXiv preprint arXiv:2604.11365},
  year   = {2026}
}