从意图到证据:用于深度研究智能体结构评估的范畴论方法
机器学习
2026-04-30 v2
摘要
深度研究智能体(DRAs)旨在通过搜索网络、检查证据并在异质来源中综合结论来回答复杂问题。我们引入了一个范畴论框架来评估和改进此类智能体。该框架将深度研究视为从用户意图到基于证据的结论的结构化映射,使检索轨迹、跨源对齐和最终综合变得明确。在此视角指导下,我们推导出一个包含 296 个双语问题、机制感知的基准测试。该基准测试针对真实研究中的四项核心结构技能:跟随多跳证据链、跨源验证声明、重新排序碎片化信息以及拒绝无支持的假设。我们通过人工验证评估了 16 个前沿系统,发现这些结构任务仍然极具挑战性:最佳系统仅达到 19.9% 的平均准确率。结果表明,强大的智能体有时可以重组证据并检测错误前提,但在长期综合和交叉密集验证方面仍然困难重重。除了评估之外,同一理论还导向了实际的系统改进。我们实现了理论引导的干预措施,如保留检索轨迹的跟踪搜索,以及添加显式验证和综合步骤的范畴工具。这些干预措施在基于 API 的深度研究系统中产生了可衡量的提升。因此,我们的工作既提供了一个具有挑战性的基准,也为构建更可靠的研究智能体提供了具体的设计指导。
引用
@article{arxiv.2603.25342,
title = {From Intent to Evidence: A Categorical Approach for Structural Evaluation of Deep Research Agents},
author = {Shuoling Liu and Zhiquan Tan and Kun Yi and Hui Wu and Yihan Li and Jiangpeng Yan and Liyuan Chen and Kai Chen and Qiang Yang},
journal= {arXiv preprint arXiv:2603.25342},
year = {2026}
}