验证的推理时扩展:通过测试时量规引导验证实现自我进化的深度研究智能体
人工智能
2026-04-30 v2
摘要
深度研究智能体(DRA)的最新进展正在改变自动化的知识发现与问题解决。虽然现有的大多数工作侧重于通过后训练来增强策略能力,但我们提出了一种替代范式:通过迭代验证策略模型的输出,并在精心设计的量规引导下,使智能体的能力自我进化。这种方法催生了验证的推理时扩展,其中智能体通过评估其生成的答案来产生迭代反馈和改进,从而实现自我提升。我们基于自动构建的DRA故障分类法推导出这些量规,该分类法系统地将智能体故障分为五大类和十三个子类。我们提出了DeepVerifier,这是一个基于量规的结果奖励验证器,它利用了验证的非对称性,在元评估F1分数上比普通的智能体作为评判和LLM评判基线高出12%-48%。为了实现实用的自我进化,DeepVerifier在测试时推理过程中作为一个即插即用的模块集成。该验证器产生详细的基于量规的反馈,并将其反馈给智能体进行迭代引导,从而在不进行额外训练的情况下优化响应。在强大的闭源LLM驱动下,这种测试时扩展在GAIA和XBench-DeepSearch的挑战性子集上带来了8%-11%的准确率提升。最后,为了支持开源进展,我们发布了DeepVerifier-4K,这是一个精心策划的监督微调数据集,包含4,646个专注于DRA验证的高质量智能体步骤。这些示例强调反思和自我批评,使开源模型能够发展出鲁棒的验证能力。
引用
@article{arxiv.2601.15808,
title = {Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification},
author = {Yuxuan Wan and Tianqing Fang and Zaitang Li and Yintong Huo and Wenxuan Wang and Haitao Mi and Dong Yu and Michael R. Lyu},
journal= {arXiv preprint arXiv:2601.15808},
year = {2026}
}
备注
ACL'2026-Findings