ReSpark:利用已有数据报告作为参考以借助 LLM 生成新报告
人机交互
2025-10-01 v3 计算与语言
摘要
创建数据报告是一项耗费精力的任务,涉及迭代式数据探索、洞察提取与叙事构建。其中一个关键挑战在于构建分析逻辑——从定义目标、转换数据到识别并传达洞察。手动构建此逻辑对认知能力要求极高。尽管经验丰富的分析师常复用过往项目的脚本,但很难为新数据集找到完美匹配的脚本。即使网上有类似分析,它们通常也只分享结果或可视化,而不共享底层代码,使得复用困难。为解决此问题,我们提出了 ReSpark,一个利用大语言模型(LLM)从现有报告中逆向工程分析逻辑并将其适配至新数据集的系统。通过生成草拟的分析步骤,ReSpark 为用户提供了热启动。它还支持交互式优化,允许用户检查中间输出、插入目标并修改内容。我们通过对比研究与用户研究评估了 ReSpark,证明了其在不依赖现有分析代码的情况下降低数据报告生成门槛的有效性。
引用
@article{arxiv.2502.02329,
title = {ReSpark: Leveraging Previous Data Reports as References to Generate New Reports with LLMs},
author = {Yuan Tian and Chuhan Zhang and Xiaotong Wang and Sitong Pan and Weiwei Cui and Haidong Zhang and Dazhen Deng and Yingcai Wu},
journal= {arXiv preprint arXiv:2502.02329},
year = {2025}
}