扩展通用数据分析智能体的规模化
计算与语言
2026-03-16 v3 人工智能
信息检索
机器学习
摘要
数据分析智能体正成为自动化科学发现以及创新 AI 愿景的关键催化剂。然而,现有方法严重依赖对专有模型的提示工程,而开源模型在应对多样化格式、大规模数据文件以及需要长期、多步骤推理的实际数据分析场景时仍显不足。本文引入 DataMind,一种面向构建通用数据分析智能体的数据合成与智能体训练配方。DataMind 解决了构建开源数据分析智能体的三个关键挑战:数据资源不足、训练策略不当以及基于代码的多轮 rollout 不稳定。具体而言,DataMind 采用:1) 细粒度任务分类学和递归易到难任务组成机制以增加合成查询的多样性和难度;2) 知识增强的轨迹抽样策略配合模型基准和规则基准过滤;3) 动态可调的训练目标,结合 SFT 与 RL 损失;4) 内存节省且稳定的基于代码的多轮 rollout 框架。在 DataMind 之上,我们构建 DataMind-12K,一个跨越多样化领域、任务类别和数据文件格式的高质量轨迹集合,专注于数据分析任务。基于 DataMind-12K 训练的 DataMind-14B 在多个数据分析基准测试中实现了 71.16% 的平均得分,超越了最强的专有基准 DeepSeek-V3.1 和 GPT-5。我们的 DataMind-7B 在所有开源模型中均表现最佳,得分为 68.10%。我们还纳入了来自探索性试验获得的若干实证见解,以期为社区提供关于智能体训练的可操作性见解。我们将发布 DataMind-12K 和 DataMind-7B、14B 供未来研究使用。
引用
@article{arxiv.2509.25084,
title = {Scaling Generalist Data-Analytic Agents},
author = {Shuofei Qiao and Yanqiu Zhao and Zhisong Qiu and Xiaobin Wang and Jintian Zhang and Zhao Bin and Ningyu Zhang and Yong Jiang and Pengjun Xie and Fei Huang and Huajun Chen},
journal= {arXiv preprint arXiv:2509.25084},
year = {2026}
}
备注
ICLR 2026