中文

AssistedDS:外部领域知识如何辅助大语言模型进行自动化数据科学的基准测试

机器学习 2025-10-24 v2 人工智能 计算与语言 统计方法学

摘要

大型语言模型(LLM)推动了数据科学工作流程的自动化。然而,它们能否像人类数据科学家在实践中那样批判性地利用外部领域知识,目前尚不清楚。为了回答这个问题,我们引入了AssistedDS(辅助数据科学),这是一个基准测试,旨在系统评估LLM在表格预测任务中如何处理领域知识。AssistedDS同时包含具有明确已知生成机制的合成数据集和真实世界的Kaggle竞赛,每个都附带有精心策划的有益和对抗性文档包。这些文档提供了关于数据清洗、特征工程和模型选择的领域特定见解。我们评估了最先进的LLM辨别和应用有益与有害领域知识的能力,评估了提交有效性、信息召回率和预测性能。我们的结果展示了三个关键发现:(1) LLM经常表现出对所提供信息的不加批判的采纳,当引入对抗性内容时,会显著损害其预测性能;(2) 有益的指导通常不足以抵消对抗性信息的负面影响;(3) 在Kaggle数据集中,LLM在处理时间序列数据、在不同折上应用一致的特征工程以及正确解释分类变量方面经常出错。这些发现凸显了当前模型在批判性评估和利用专家知识方面的巨大差距,强调了为开发更鲁棒、知识感知的自动化数据科学系统而进行的重要研究方向。我们的数据和代码在此公开:https://github.com/jeremyxianx/Assisted-DS。

关键词

引用

@article{arxiv.2506.13992,
  title  = {AssistedDS: Benchmarking How External Domain Knowledge Assists LLMs in Automated Data Science},
  author = {An Luo and Xun Xian and Jin Du and Fangqiao Tian and Ganghua Wang and Ming Zhong and Shengchun Zhao and Xuan Bi and Zirui Liu and Jiawei Zhou and Jayanth Srinivasa and Ashish Kundu and Charles Fleming and Mingyi Hong and Jie Ding},
  journal= {arXiv preprint arXiv:2506.13992},
  year   = {2025}
}