Tapilot-Crossing:面向交互式数据分析智能体的 LLM 基准测试与演化
人工智能
2024-03-11 v1
摘要
交互式数据分析,即人类与 LLM 智能体之间的协作,能够实现实时数据探索以支持明智的决策。收集用于数据分析的真实交互日志所面临的挑战与成本,阻碍了大型语言模型(LLM)智能体在此任务上的定量评估。为缓解这一问题,我们引入了 Tapilot-Crossing,一个用于评估 LLM 智能体在交互式数据分析上的新基准。Tapilot-Crossing 包含 1024 次交互,涵盖 4 种实际场景:Normal、Action、Private 和 Private Action。值得注意的是,Tapilot-Crossing 由一个经济的多智能体环境 Decision Company 构建,仅需极少人工。我们在 Tapilot-Crossing 上评估了主流且先进的 LLM 智能体,凸显了交互式数据分析的挑战。此外,我们提出了自适应交互反思(Adaptive Interaction Reflection, AIR),一种引导 LLM 智能体从成功历史中学习的自生成反思策略。实验表明,AIR 能将 LLM 演化为有效的交互式数据分析智能体,实现高达 44.5% 的相对性能提升。
引用
@article{arxiv.2403.05307,
title = {Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis Agents},
author = {Jinyang Li and Nan Huo and Yan Gao and Jiayi Shi and Yingxiu Zhao and Ge Qu and Yurong Wu and Chenhao Ma and Jian-Guang Lou and Reynold Cheng},
journal= {arXiv preprint arXiv:2403.05307},
year = {2024}
}
备注
30 pages, 7 figures