中文

ELT-Bench:用于评估 AI 代理在 ELT 流水线中的端到端基准

数据库 2025-04-16 v2 人工智能

摘要

从事者正越来越多地采用包含 Extract-Load-Transform (ELT) 流水线的云数据仓库,但设计这些流水线常需大量手动工作才能确保正确性。近期进展表明,基于 AI 的方法在数据任务(如文本到 SQL)方面展现出强大的能力,这为缓解开发 ELT 流水线的手动工作提供了机会。然而,当前数据工程中的基准仅评估孤立任务(如使用数据工具和编写数据转换查询),而缺少对 AI 代理用于生成端到端 ELT 流水线能力的评估。这一差距通过本文提出的 ELT-Bench 进行了填补。ELT-Bench 包含 100 条流水线,涵盖 835 个数据源表和 203 个数据模型,涉及多个领域。通过模拟现实场景下的多样化数据源集成和流行数据工具的使用,ELT-Bench 评估 AI 代理在处理复杂数据工程工作流程方面的能力。AI 代理必须与数据库和数据工具交互,编写代码和 SQL 查询,并协调整个流水线的每个阶段。我们在 ELT-Bench 上评估了两个具有代表性的编码代理框架,Spider-Agent 和 SWE-Agent,使用六种流行的大型语言模型 (LLM)。最佳-performing 代理 Spider-Agent Claude-3.7-Sonnet(带扩展思考)仅正确生成 3.9% 的数据模型,平均成本为 $4.30,每个流水线平均步数为 89.3 步。我们的实验结果展示了 ELT-Bench 的挑战,并凸显了需要更先进的 AI 代理以减少 ELT 工作流程中手动工作量的需求。我们的代码和数据已在 https://github.com/uiuc-kang-lab/ELT-Bench 上提供。

关键词

引用

@article{arxiv.2504.04808,
  title  = {ELT-Bench: An End-to-End Benchmark for Evaluating AI Agents on ELT Pipelines},
  author = {Tengjun Jin and Yuxuan Zhu and Daniel Kang},
  journal= {arXiv preprint arXiv:2504.04808},
  year   = {2025}
}

备注

14 pages, 18 figures