中文

深度自演化推理

计算与语言 2025-10-21 v1

摘要

长链式思维推理已成为大型语言模型中高级推理的基石。虽然最近的验证-精炼框架使专有模型能够解决奥林匹克级别问题,但其有效性依赖于强大可靠的验证与纠正能力,而这在开源小型模型中仍显脆弱。本文展示,即便在难任务上验证与精炼能力较弱,模型的推理极限仍可通过一种称为深度自演化推理(Deep Self-Evolving Reasoning, DSER)的概率范式大幅扩展。我们将迭代推理概念化为马尔可夫链,其中每一步代表解空间中的随机转移。关键洞察是:只要改进概率略高于退化概率,即可保证收敛至正确解。通过并行运行多个长期自演化过程,DSER 放大这些微小的正向趋势,使模型逐渐逼近正确答案。我们在 DeepSeek-R1-0528-Qwen3-8B 模型上实验验证。在挑战性的 AIME 2024-2025 基准测试中,DSER 解决了 9 个不可解问题中的 5 个问题,并提升了整体性能,使该紧凑模型超越了其 600B 参数教师的单轮准确率。除了即时的测试规模化用途外,DSER 框架还用于诊断当前开源推理模型的根本局限。通过清晰界定其在自我验证、精炼和稳定性方面的不足,我们的发现为开发具备强大内在自演化能力的下一代模型奠定了明确的研究议程。

关键词

引用

@article{arxiv.2510.17498,
  title  = {Deep Self-Evolving Reasoning},
  author = {Zihan Liu and Shun Zheng and Xumeng Wen and Yang Wang and Jiang Bian and Mao Yang},
  journal= {arXiv preprint arXiv:2510.17498},
  year   = {2025}
}