中文

DSGym:用于评估和训练数据科学智能体的全方位框架

人工智能 2026-01-26 v1

摘要

数据科学智能体有望通过将数据转化为可执行的分析与发现,从而加速发现和洞察生成。然而,现有数据科学基准因评估界面碎片化导致跨基准比较困难、任务覆盖范围狭窄且缺乏严格的数据 grounding。特别是,我们表明当前基准中大量任务可在不使用实际数据的情况下解决。为此,我们引入 DSGym,一个用于在自包含执行环境中评估和训练数据科学智能体的标准化框架。不同于静态基准,DSGym 提供模块化架构,便于添加任务、智能体骨架和工具,使其成为一个活跃且可扩展的测试台。我们精选 DSGym-Tasks,一种全方位任务套件,通过质量和捷径可行性过滤,对现有基准进行标准化和细化。我们进一步通过 (1) DSBio:基于文献且数据 grounding 的专家推导生物信息学任务,以及 (2) DSPredict:涵盖计算机视觉、分子预测和单细胞扰动等多个领域的具挑战性预测任务来扩充覆盖范围。除评估外,DSGym 还支持通过执行验证的数据合成管道进行智能体训练。作为案例研究,我们构建了包含 2000 例的训练集,在 DSGym 中训练的 4B 参数模型在标准化分析基准上超越 GPT-4o。总体而言,DSGym 实现了对智能体在真实科学情境下规划、实现和验证数据分析能力的严格端到端测量。

关键词

引用

@article{arxiv.2601.16344,
  title  = {DSGym: A Holistic Framework for Evaluating and Training Data Science Agents},
  author = {Fan Nie and Junlin Wang and Harper Hua and Federico Bianchi and Yongchan Kwon and Zhenting Qi and Owen Queen and Shang Zhu and James Zou},
  journal= {arXiv preprint arXiv:2601.16344},
  year   = {2026}
}