众多AI分析师,单一数据集:探索代理数据科学多元宇宙
人工智能
2026-03-12 v2 机器学习
摘要
经验性结论不仅取决于数据,也取决于整个研究过程中所做的分析决策。许多分析师研究已量化了这种依赖性:独立团队对同一数据集上的同一假设进行测试时,常常得出相互冲突的结论。但此类研究需要昂贵的人类协调,且很少进行。我们展示,基于大型语言模型(Large Language Model,简称LLM)构建的完全自主AI分析师能够以低廉且可扩展的方式复制人类多分析师研究中所观察到的结构化分析多样性。在我们的框架中,每个AI分析师独立执行固定数据集和假设上的完整分析管道;单独的AI审计员筛选每个运行的可方法论有效性。在三个跨越不同领域的数据集上,AI分析师产生的分析显示出在效应大小、p值和结论方面存在显著的分散程度。这一分散程度可追溯到数据预处理、模型指定和推断等可识别的分析选择,这些选择在不同LLM和人格条件下呈系统性变化。关键的是,结果是可引导的:重新分配分析师人格或LLM会即使在以方法论为据的运行中,也会导致结果分布的变化。这些结果凸显了AI自动化经验科学的核心挑战:当可防御性分析变得廉价时,证据将变得丰富且易受选择性报告的影响。然而,相同的能力可能也有助于解决这一问题:将分析师结果视为分布可使分析不确定性变得可见,针对已发布规范部署AI分析师可揭示多少不匹配源于不明确的设计选择。综上所述,我们的结果动员了新的透明度规范:AI生成的分析应伴随多元宇宙式报告以及完整披露所使用的提示词,至少等同于代码和数据。
引用
@article{arxiv.2602.18710,
title = {Many AI Analysts, One Dataset: Navigating the Agentic Data Science Multiverse},
author = {Martin Bertran and Riccardo Fogliato and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2602.18710},
year = {2026}
}