AgentDS 技术报告:衡量人类-AI 协作在领域特定数据科学中的未来
机器学习
2026-03-20 v1 人工智能
统计方法学
摘要
数据科学在将复杂数据转化为可操作见解方面发挥着关键作用。近期大语言模型 (LLM) 和人工智能 (AI) 代理的发展显著自动化了数据科学工作流程。然而,AI 代理在多大程度上能够匹配领域专家在特定数据科学任务中的表现,以及在哪些方面人类专家仍能提供优势,仍不为人所知。我们引入AgentDS,一个用于评估 AI 代理和人类-AI 协作在领域特定数据科学中性能的基准和竞赛。AgentDS 包含 17 个挑战,覆盖六个行业:商业、食品生产、医疗保健、保险、制造业和零售银行。我们组织了一场公开竞赛,涉及 29 个团队和 80 名参赛者,系统比较了人类-AI 协作方法与 AI-only 基线。我们的结果表明,当前的 AI 代理在领域特定推理方面仍面临挑战。AI-only 基线的表现接近或低于竞赛参赛者的中位数,而最强的解决方案则来自人类-AI 协作。这些发现挑战了完全由 AI 自动化的叙事,凸显了人类在数据科学中持久的重要性,同时指明了下一代 AI 的发展方向。访问 AgentDS 网站了解更多信息:https://agentds.org/ 并获取开源数据集:https://huggingface.co/datasets/lainmn/AgentDS。
引用
@article{arxiv.2603.19005,
title = {AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science},
author = {An Luo and Jin Du and Xun Xian and Robert Specht and Fangqiao Tian and Ganghua Wang and Xuan Bi and Charles Fleming and Ashish Kundu and Jayanth Srinivasa and Mingyi Hong and Rui Zhang and Tianxi Li and Galin Jones and Jie Ding},
journal= {arXiv preprint arXiv:2603.19005},
year = {2026}
}