DSBench:数据科学智能体离数据科学专家还有多远?
人工智能
2025-04-14 v3 计算与语言
摘要
大型语言模型 (LLMs) 和大型视觉语言模型 (LVLMs) 已在语言/视觉推理方面展现出惊人的能力,催生了构建面向特定应用(如购物助手或 AI 软件工程师)的智能体的最新趋势。最近提出了许多数据科学基准测试以探讨其在数据科学领域的性能。然而,现有数据科学基准测试相较于现实世界的数据科学应用仍显不足,设置过于简化。为弥合这一差距,我们引入 DSBench,一个旨在评估数据科学智能体的全面基准测试。该基准包含 466 个数据分析任务和 74 个数据建模任务,来源于 Eloquence 和 Kaggle 竞赛。DSBench 通过包含长上下文、多模态任务背景、与大数据文件和多表结构进行推理,以及执行端到端数据建模任务等现实情景。我们评估了最新的 LLMs、LVLMs 和智能体,发现它们在大多数任务上表现不佳,最佳智能体仅解决 34.12%的数据分析任务,并实现 34.74% 的相对性能差距 (RPG)。这些发现凸显了开发更加实用、智能和自主数据科学智能体的必要性。
引用
@article{arxiv.2409.07703,
title = {DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?},
author = {Liqiang Jing and Zhehui Huang and Xiaoyang Wang and Wenlin Yao and Wenhao Yu and Kaixin Ma and Hongming Zhang and Xinya Du and Dong Yu},
journal= {arXiv preprint arXiv:2409.07703},
year = {2025}
}