深度信息合成基准
人工智能
2026-02-25 v1 计算与语言
信息检索
机器学习
摘要
大型语言模型 (LLM)-基的智能体日益用于解决涉及工具使用(如网页浏览、代码执行和数据分析)的复杂任务。然而,当前的评估基准不足以评估其解决需要从多个来源综合信息并推断简单事实检索之外洞见的真实世界任务的能力。为此,我们引入 DEEPSYNTH,一个新颖的基准,旨在评估智能体在现实、耗时的任务上表现,这些任务将信息收集、合成和结构化推理结合起来,以产生洞见。DEEPSYNTH 包含跨越 7 个领域和数据源、覆盖 67 个国家的 120 个任务。通过多阶段数据收集管道构建,要求注释员收集官方数据源、创建假设、进行手动分析并设计具有可验证答案的任务。对 DEEPSYNTH 的评估显示,11 个最先进的 LLM 和深度研究智能体在 LLM-judge 指标下的最高 F1 分数分别为 8.97 和 17.5,凸显了该基准的难度。我们的分析表明,当前智能体在幻觉和处理大规模信息空间推理方面仍面临挑战,突显了 DEEPSYNTH 在指导未来研究方面的关键作用。
引用
@article{arxiv.2602.21143,
title = {A Benchmark for Deep Information Synthesis},
author = {Debjit Paul and Daniel Murphy and Milan Gritta and Ronald Cardenas and Victor Prokhorov and Lena Sophia Bolliger and Aysim Toker and Roy Miles and Andreea-Maria Oncescu and Jasivan Alex Sivakumar and Philipp Borchert and Ismail Elezi and Meiru Zhang and Ka Yiu Lee and Guchun Zhang and Jun Wang and Gerasimos Lampouras},
journal= {arXiv preprint arXiv:2602.21143},
year = {2026}
}
备注
Accepted at ICLR 2026