中文

CoT2-Meta:面向测试时推理的预算化元认知控制

人工智能 2026-03-31 v1

摘要

最近的测试时推理方法通过生成更多候选链或搜索更大的推理树来提升性能,但通常缺乏对何时扩张、何时修剪、如何修复以及何时放弃的明确控制。我们引入CoT2-Meta,一个训练自由的元认知推理框架,将对象级链式思考生成与对部分推理轨迹的元级控制相结合。该框架集成了四个组件:策略条件化思想生成、树结构搜索、用于步骤级推理评估的在线过程占卜师,以及分配计算的元控制器,通过扩张、修剪、修复、停止和后备决策。在匹配的推理预算下,CoT2-Meta consistently优于强大的单路径、基于抽样和基于搜索的基线,包括ReST-MCTS。在默认背bone上,它在MATH上实现92.8 EM,在GPQA上达到90.4准确率,在GSM8K上达到98.65 EM,在BBEH上达到75.8准确率,在MMMU-Pro上达到85.6准确率,在HLE上达到48.8准确率,相对于最强的非CoT2-Meta基线分别获得+3.6、+5.2、+1.15、+2.0、+4.3和+4.3分的提升。除这些核心结果外,该框架在更广泛的15个基准套件上仍然有效,涵盖知识与问答、多跳推理、编码和跨分布评估。额外分析显示其更好的计算扩展性、改进的校准、更强的选择性预测、针对性的修复行为以及跨背bone家族的持续提升。这些结果表明,显式的元认知控制是可靠且计算高效测试时推理系统的实用设计原则。

关键词

引用

@article{arxiv.2603.28135,
  title  = {CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning},
  author = {Siyuan Ma and Bo Gao and Zikai Xiao and Hailong Wang and Xinlei Yu and Rui Qian and Jiayu Qian and Luqi Gong and Yang Liu},
  journal= {arXiv preprint arXiv:2603.28135},
  year   = {2026}
}