中文

通过非对称验证推进深度搜索的测试时计算极限

人工智能 2025-10-08 v1

摘要

测试时计算既可以顺序扩展,也可以并行扩展。顺序扩展涉及延长生成过程,而并行扩展涉及对多个候选输出进行验证与选择。在将这两种策略结合起来后,才形成了最强大的AI系统,如 Grok 4 Heavy 和 GPT-5 Pro。在某些情境下(例如解数独谜题),验证响应的工作量远小于生成工作量。这种属性被称为“非对称验证”,突显了测试时计算(TTS)的巨大潜力。本文研究了深度搜索代理的顺序与并行TTS,基于验证在此场景下往往远小于生成的直觉。在实验中,我们首先表明,诸如预算强制等顺序扩展方法在最初有效,但很快会性能下降。然而,凭借非对称验证,我们仅为验证器分配适度的计算资源,便能实现显著的性能提升。我们使用旗舰开源模型进行实验,并通过TTS将其扩展为其“Heavy”变体。这些深度研究代理在BrowseComp等基准测试上实现了最高可达27个绝对分数的提升。令人惊讶的是,作为开源替代方案,GLM-4.5 Heavy 在BrowseComp上的准确率达到{\bf 54.0\%},在GAIA上达到{\bf 66.0\%},与OpenAI Deep Research等最佳专有选项相当。Tongyi-DeepResearch Heavy 在BrowseComp上的准确率达到{\bf 69.0\%},显著超越了最佳的专有结果。

关键词

引用

@article{arxiv.2510.06135,
  title  = {Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification},
  author = {Weihao Zeng and Keqing He and Chuqiao Kuang and Xiaoguang Li and Junxian He},
  journal= {arXiv preprint arXiv:2510.06135},
  year   = {2025}
}