KramaBench:面向数据湖数据到洞察管道的AI系统基准
数据库
2026-03-09 v3 人工智能
多智能体系统
摘要
从真实数据湖中发现洞察(可能包含不完整、半结构化和非结构化数据)需要多种数据处理任务,从提取和清洗到集成、分析和建模,还需要领域知识和项目特定洞察。虽然AI模型在推理和代码生成方面表现卓越,但其设计和执行解决数据湖到洞察挑战的复杂管道能力尚不清楚。我们引入KramaBench,包含104个手动精选和解决的挑战,覆盖1700个文件、24个数据源和6个领域。KramaBench侧重于测试AI系统解决需要自动编排不同数据任务的端到端挑战的能力。KramaBench还提供全面的评估框架,评估AI系统的管道设计和 individual data task 实现能力。我们使用单智能体参考框架DS-Guru评估8个LLM,包括开源和闭源的单智能体和多智能体系统,发现虽然当前智能体系统可能处理孤立数据科学任务并生成合理的草案管道,但在生成可工作的端到端管道方面仍有困难。在KramaBench上,最佳系统仅达到55%的端到端准确率(数据湖场景)。即使检索完美,准确率也只能达到62%。领先的LLM可识别最多42%的重要数据任务,但只能完全实现20%的 individual data task。我们的代码、参考框架和数据已在https://github.com/mitdbg/KramaBench 上提供。
引用
@article{arxiv.2506.06541,
title = {KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes},
author = {Eugenie Lai and Gerardo Vitagliano and Ziyu Zhang and Om Chabra and Sivaprasad Sudhir and Anna Zeng and Anton A. Zabreyko and Chenning Li and Ferdi Kossmann and Jialin Ding and Jun Chen and Markos Markakis and Matthew Russo and Weiyang Wang and Ziniu Wu and Michael J. Cafarella and Lei Cao and Samuel Madden and Tim Kraska},
journal= {arXiv preprint arXiv:2506.06541},
year = {2026}
}