中文

DABstep:面向多步推理的数据智能体基准

机器学习 2025-07-01 v1 人工智能

摘要

我们提出 DABstep,一个用于评估 AI 智能体在真实世界数据分析任务中多步推理能力的新型基准测试。DABstep 包含来自金融分析平台的450多个真实挑战,要求模型在异构文档中结合基于代码的数据处理与上下文推理。每个任务都要求采用迭代的、多步骤的方法,测试数据操作、跨引用多个来源以及精确结果报告的能力。该基准提供事实式答案格式,配备自动正确性检查,实现大规模客观评分。我们评估了领先的基于大语言模型的智能体,发现即便是最佳智能体在最难任务上也仅 achieving 14.55% 的准确率。我们详细阐述了基准的设计、数据集构成、任务表述、评估协议,给出基线结果并分析失败模式。DABstep 随推出的公开排行榜和工具包旨在加速自主数据分析领域的研究。

关键词

引用

@article{arxiv.2506.23719,
  title  = {DABstep: Data Agent Benchmark for Multi-step Reasoning},
  author = {Alex Egg and Martin Iglesias Goyanes and Friso Kingma and Andreu Mora and Leandro von Werra and Thomas Wolf},
  journal= {arXiv preprint arXiv:2506.23719},
  year   = {2025}
}

备注

13 pages, 5 figures