中文

DSAEval:在广泛的真实世界数据科学问题上评估数据科学智能体

人工智能 2026-01-21 v1 计算与语言

摘要

近期基于LLM的数据智能体旨在自动化从数据分析到深度学习的数据科学任务。然而,现实世界数据科学问题的开放性特征——通常跨越多个分类体系且缺乏标准答案——对评估构成了重大挑战。为解决此问题,我们引入了DSAEval,这是一个包含641个真实世界数据科学问题的基准,基于285个多样化数据集构建,涵盖结构化和非结构化数据(如视觉和文本)。DSAEval包含三个显著特征:(1) 多模态环境感知,使智能体能够解释来自文本和视觉等多种模态的观察结果;(2) 多查询交互,反映真实世界数据科学项目的迭代和累积特性;(3) 多维评估,在推理、代码和结果方面提供整体评估。我们使用DSAEval系统评估了11种先进的智能体LLM。结果显示,Claude-Sonnet-4.5取得了最强的整体性能,GPT-5.2效率最高,而MiMo-V2-Flash最具成本效益。我们进一步证明,多模态感知持续提升了视觉相关任务的性能,提升幅度从2.04%到11.30%不等。总体而言,尽管当前的数据科学智能体在结构化数据和常规数据分析工作流上表现良好,但在非结构化领域仍存在重大挑战。最后,我们提供了关键见解并概述了推进数据科学智能体开发的未来研究方向。

关键词

引用

@article{arxiv.2601.13591,
  title  = {DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems},
  author = {Maojun Sun and Yifei Xie and Yue Wu and Ruijian Han and Binyan Jiang and Defeng Sun and Yancheng Yuan and Jian Huang},
  journal= {arXiv preprint arXiv:2601.13591},
  year   = {2026}
}