iAgentBench:面向高流量主题的信息寻求智能体感知能力基准测试
计算与语言
2026-03-06 v1 信息检索
机器学习
多智能体系统
摘要
随着搜索增强型生成式问答系统的出现,用户日益依赖于浏览、聚合和跨来源协调证据的工具。然而,许多广泛使用的问答基准仍可通过检索单个相关段落来回答,因而不适用于衡量跨来源感知能力,如整合证据、追踪因果链条、以及解决主题不同方面的依赖关系。我们提出 iAgentBench,这是一个动态的 ODQA 基准,旨在针对这些更高层次的信息需求,同时保持问题自然且符合现实信息寻求行为。iAgentBench 从真实世界的注意力信号中提取种子主题,并使用常见的用户意图模式构建类用户问题,其答案需要组合来自多个来源的证据,而不仅仅是提取单个片段。每个实例均附带可追溯的证据和可审计的中间产物,以支持防止污染检查,并 enable 对检索与合成故障进行细粒度诊断。跨多个大语言模型的实验表明,检索可提高准确率,但检索alone 并不能可靠地解决这些问题,这凸显了评估证据使用而非仅证据获取的必要性。
引用
@article{arxiv.2603.04656,
title = {iAgentBench: Benchmarking Sensemaking Capabilities of Information-Seeking Agents on High-Traffic Topics},
author = {Preetam Prabhu Srikar Dammu and Arnav Palkhiwala and Tanya Roosta and Chirag Shah},
journal= {arXiv preprint arXiv:2603.04656},
year = {2026}
}