VeriTrace:为深度研究代理演化心理模型
人工智能
2026-05-26 v1
摘要
深度研究代理面临广泛、相互依赖且持续不确定的信息。现有系统探索何为演化的中间表征,但将其演化留给LLM的隐式推理。缺乏显式调控,中间层容易受到混合质量信息的污染,并在其依赖项中传播错误,因此模型规模常常成为替代缺失调控的手段。我们认为,代理的心理模型应通过显式反馈不断演化,以持续将任务理解与现实对齐,我们识别了三种调控环路:解释性更新、偏差反馈和模式修订。我们在 VeriTrace 中实现了这一框架,显式地实现了这三个环路。使用匹配的 Qwen3.5-27B 底层模型,VeriTrace 在 DeepResearch Bench(DRB)Insight(提升1.49 pp Overall)方面优于最强匹配基线4.22 pp,在 DeepConsult 上实现5.9 pp 的 Overall 胜率。以 Config-DeepSeek 为例,它在 DRB 上实现了最强可复现的开源结果。
引用
@article{arxiv.2605.26081,
title = {VeriTrace: Evolving Mental Models for Deep Research Agents},
author = {Haolang Zhao and Yunbo Long and Lukas Beckenbauer and Alexandra Brintrup},
journal= {arXiv preprint arXiv:2605.26081},
year = {2026}
}