中文

MatryoshkaThinking:递归测试时扩展实现高效推理

计算与语言 2025-10-14 v1 人工智能

摘要

测试时扩展已成为语言建模中一种有前景的范式,即在推理过程中分配额外的计算资源以提升模型性能。最近的方法,如DeepConf,已证明了该策略的有效性,然而,它们通常需要大量的计算开销才能取得有竞争力的结果。在这项工作中,我们提出了MatryoshkaThinking,一种新颖的方法,它在保持最先进性能的同时显著降低了计算成本。具体来说,MatryoshkaThinking在AIME2025上达到了99.79的分数,仅使用了DeepConf所需计算的4%。我们方法的核心在于递归利用模型在推理、验证和总结方面的内在能力,这些能力共同增强了对正确解的保留,并缩小了Pass@k与Pass@1之间的差距。在多个开源模型和具有挑战性的多模态推理基准上的全面评估验证了我们方法的有效性和通用性。这些发现为设计高效且可扩展的高级语言模型测试时推理策略提供了新的见解。

关键词

引用

@article{arxiv.2510.10293,
  title  = {MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning},
  author = {Hongwei Chen and Yishu Lei and Dan Zhang and Bo Ke and Danxiang Zhu and Xuyi Chen and Yuxiang Lu and Zhengjie Huang and Shikun Feng and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2510.10293},
  year   = {2025}
}