OpenDeepThink:基于布拉德利-特里推理的并行推理
人工智能
2026-05-19 v2
摘要
测试时计算规模是提高大语言模型推理能力的主要方向。现有方法主要通过延长单条推理链来扩展深度。通过并行采样多个候选方案来扩展宽度是直接的做法,但会引入选择瓶颈:由于基于点评的 LLM 判断噪声大且存在偏差,在没有真实验证器的情况下选择最佳候选方案。为此,我们引入 OpenDeepThink,一种基于人口的测试时计算框架,通过两两布拉德利-特里比较进行选择。每一轮生成中,LLM 对随机配对的候选方案进行判断,并通过布拉德利-特里聚合投票结果以获得全局排名;保留排名靠前的候选方案,并对前三分之二进行突变(使用在比较期间产生的自然语言批评),后四分之一被丢弃。OpenDeepThink 在八轮顺序 LLM 调用中,将 Gemini 3.1 Pro 的有效 Codeforces Elo 提升了 +405 分(约 27 分钟的墙面时间)。该管道可在无需微调的情况下在较弱和较强的模型之间迁移,在多领域 HLE 基准测试中,收益集中在可客观验证的领域,主观领域则相反。我们发布了 CF-73,一套由 73 个专家评分的 Codeforces 题目,包含国际铂金级注释,且在 99% 的本地评估中与官方裁决一致。
引用
@article{arxiv.2605.15177,
title = {OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation},
author = {Shang Zhou and Wenhao Chai and Kaiyuan Liu and Huanzhi Mao and Qiuyang Mang and Jingbo Shang},
journal= {arXiv preprint arXiv:2605.15177},
year = {2026}
}
备注
19 pages, 4 figures