中文

AIRepr:面向评估 LLM 在数据科学中可重复性的分析师-检查员框架

机器学习 2025-11-10 v3 人工智能 计算与语言 人机交互

摘要

大型语言模型 (LLM) 越来越多地用于通过可执行代码生成自动化数据分析。然而,数据科学任务常常存在多种统计上有效的解决方案,例如不同的建模策略,这使得了解分析背后的推理逻辑(而不仅仅是结果)至关重要。虽然手动审查 LLM 生成的代码有助于确保统计可靠性,但代价是昂贵的且需要专业知识。更可扩展的做法是评估支配代码生成的底层工作流程——逻辑计划。然而,尚不清楚如何评估 LLM 生成的工作流程是否支持可重复的实现。为此,我们提出 AIRepr,一个用于自动评估和改进 LLM 生成数据分析工作流程可重复性的分析师-检查员框架。我们的框架基于统计原理,支持可扩展的自动评估。我们引入两种新颖的可重复性提升提示策略,并将其在 15 对分析师-检查员 LLM 以及来自三个公共基准的 1,032 个任务上与标准提示进行基准测试。我们的发现表明,可重复性更高的工作流程也会产生更准确的分析结果,并且可重复性提升提示在两项指标上均显著提高。这为在数据科学中建立透明、可靠且高效的人机协作提供了基础。我们的代码已公开。

关键词

引用

@article{arxiv.2502.16395,
  title  = {AIRepr: An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science},
  author = {Qiuhai Zeng and Claire Jin and Xinyue Wang and Yuhan Zheng and Qunhua Li},
  journal= {arXiv preprint arXiv:2502.16395},
  year   = {2025}
}

备注

Accepted to 2025 EMNLP findings