PRISM-MCTS:基于元认知反思从推理轨迹中学习
人工智能
2026-04-08 v1 计算与语言
摘要
PRISM-MCTS:基于元认知反思从推理轨迹中学习。Siyuan Cheng、Bozhong Tian、Yanchao Hao、Zheng Wei。发布于 2026年4月6日,最后修改于2026年4月6日。ACL 2026 Findings Conference,Area Chairs、Reviewers、Publication Chairs、Authors Revisions。CC BY 4.0 许可。关键词:高效/低资源方法用于NLP、生成、问答。摘要:推理模型的出现,如OpenAI o1,标志着从直觉式认知向 deliberative 认知的转变,有效地将规模定律从预训练范式转向test-time计算范式。尽管蒙特卡洛树搜索(MCTS)在该领域显示出前景,但现有方法通常将每个 rollout视为独立的轨迹。这种缺乏信息共享导致严重的低效和显著的计算冗余,因为搜索过程未能利用来自先前探索的见解。为此,我们提出PRISM-MCTS,一种受人类并行思考和反思过程启发的新型推理框架。PRISM-MCTS将过程奖励模型(PRM)与动态共享记忆集成,捕获“启发式”和“谬误”。通过强化成功的策略并修剪错误的分支,PRISM-MCTS实现了精细化。此外,我们发展了PRM的数据高效训练策略,在few-shot regime下实现高保真评估。跨 diverse 推理基准的实证评估证明了PRISM-MCTS的有效性。值得注意的是,它在GPQA上所需的轨迹数量减少了一半,超过了MCTS-RAG和Search-o1,表明它通过谨慎推理而非穷举搜索来实现推理规模化。
引用
@article{arxiv.2604.05424,
title = {PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection},
author = {Siyuan Cheng and Bozhong Tian and YanChao Hao and Zheng Wei},
journal= {arXiv preprint arXiv:2604.05424},
year = {2026}
}