中文

面向数据智能体的 InsightEval:一个专家精选的洞察发现评估基准

人工智能 2026-05-29 v2

摘要

数据分析已成为科学研究不可或缺的组成部分。要发现隐藏于海量数据集中的潜在知识与洞察,需要进行深入的探索性分析以充分发挥其价值。随着大语言模型 (LLM) 和多智能体系统的兴起,越来越多的研究人员开始利用这些技术进行洞察发现。然而,目前缺乏针对洞察发现能力的评估基准。作为目前最为全面的框架之一的 InsightBench 也存在诸多严重缺陷:格式不一致、目标设计不合理、洞察冗余。这些问题可能显著影响数据质量和智能体评估。为此,我们彻底调查了 InsightBench 的不足之处,并提出高质量洞察基准的必要标准。针对此需求,我们构建了数据 curated 流程以构建新的名为 InsightEval 的数据集。我们进一步引入一种新型指标来衡量智能体的探索性能。通过在 InsightEval 上进行大量实验,我们突出了自动化洞察发现中的现存挑战,并提出若干关键发现以指导该前沿方向的未来研究。

关键词

引用

@article{arxiv.2511.22884,
  title  = {InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Data Agents},
  author = {Zhenghao Zhu and Yuanfeng Song and Xin Chen and Chengzhong Liu and Yakun Cui and Caleb Chen Cao and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2511.22884},
  year   = {2026}
}