Empirical-MCTS:基于双经验蒙特卡罗树搜索的连续智能体演化
人工智能
2026-02-05 v1 计算与语言
摘要
推理时间扩展策略,特别是蒙特卡罗树搜索 (MCTS),显著提升了大型语言模型 (LLM) 的推理能力。然而,当前方法仍主要是无状态的,在每个问题实例后都丢弃成功的推理模式,未能模拟人类解决问题中经验积累的特征。为弥合这一差距,我们引入 Empirical-MCTS,一个双循环框架,将无状态搜索转化为连续的非参数学习过程。该框架通过两种新机制将局部探索与全局记忆优化统一:成对经验演化式元提示词生成 (PE-EMP) 和记忆优化智能体。PE-EMP 作为局部搜索中的自省优化器,利用成对反馈动态合成自适应准则并实时演化元提示词 (系统提示词)。同时,记忆优化智能体管理一个动态的策略先验库,通过原子操作在不同问题之间提炼高质量见解。广泛的在复杂推理基准测试上的评估,包括 AIME25、ARC-AGI-2 和 MathArena Apex,表明 Empirical-MCTS 在性能上显著优于无状态 MCTS 策略和独立经验驱动智能体。这些结果凸显了将结构化搜索与经验积累相结合对于掌握复杂开放式推理任务的关键必要性。
引用
@article{arxiv.2602.04248,
title = {Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search},
author = {Hao Lu and Haoyuan Huang and Yulin Zhou and Chen Li and Ningxin Zhu},
journal= {arXiv preprint arXiv:2602.04248},
year = {2026}
}
备注
9 pages, 5 figures