中文

衡量数据科学自动化:面向 AI 助手与智能体的评估工具综述

人工智能 2025-10-23 v2 计算与语言

摘要

数据科学旨在从数据中提取洞见以支持决策过程。近来,大型语言模型 (LLM) 越来越多地被用作数据科学的助手,通过建议想法、技术和小段代码,或用于结果解释和报告。现在,LLM 智能体(即由 LLM 驱动并配备额外功能——如代码执行和知识库——能够执行自主行动并与数字环境交互的 AI 系统)的兴起,有望实现某些数据科学活动的真正自动化。在本文中,我们综述了对用于数据科学的 LLM 助手和智能体的评估。我们发现:(1) 主要关注一小部分目标导向的活动,很大程度上忽略了数据管理和探索性活动;(2) 集中在纯粹的辅助或完全自主的智能体上,没有考虑人机协作的中间层次;(3) 强调替代人类,因此忽视了通过任务转换实现更高水平自动化的可能性。

关键词

引用

@article{arxiv.2506.08800,
  title  = {Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents},
  author = {Irene Testini and José Hernández-Orallo and Lorenzo Pacchiardi},
  journal= {arXiv preprint arXiv:2506.08800},
  year   = {2025}
}

备注

Published in Transactions of Machine Learning Research (TMLR), 10/2025 https://openreview.net/forum?id=MB0TCLfLn1