数据主导的自主 AI 研究
机器学习
2026-05-14 v2 人工智能
摘要
随着模型家族、训练配方和计算预算日益标准化,机器学习系统的进一步提升越来越依赖于数据。然而,数据工程仍大体上是手动且非结构化的:实践者反复搜索外部数据集、调整数据以适应现有管道、通过下游训练验证候选数据,并在先前尝试中保留经验教训。我们研究了任务条件化的自主数据工程,其中 autonomous agent 通过仅优化数据方面(包括外部数据发现、数据选择与组合、清洗与转换)来改进固定的学习算法,以获得更强的下游解决方案且保持学习算法不变。为解决自主数据工程固有的开放式搜索空间、分支相关的细化和延迟验证问题,我们提出 DataMaster,一个数据主导框架,集成了树状搜索、共享候选数据和累积记忆。DataMaster 由三个关键组件构成:DataTree 组织替代数据工程分支、共享 Data Pool 存储发现的外部数据源以供复用、Global Memory 记录节点结果、artifacts 和可复用发现。总体而言,这些组件使 agent 能够发现候选数据、构建可执行训练输入、通过下游反馈进行评估,并在分支之间携带有用证据。我们在两种类型的数据基准进行评估:MLE-Bench Lite 和 PostTrainBench。在 MLE-Bench Lite 上,DataMaster 将奖牌率提高了 32.27%;在 PostTrainBench 上,它在 GPQA 上超越 instruct model(31.02% vs 30.35%)。
关键词
引用
@article{arxiv.2605.10906,
title = {DataMaster: Data-Centric Autonomous AI Research},
author = {Yaxin Du and Xiyuan Yang and Zhifan Zhou and Wanxu Liu and Zixing Lei and Zimeng Chen and Fenyi Liu and Haotian Wu and Yuzhu Cai and Zexi Liu and Xinyu Zhu and WenHao Wang and Linfeng Zhang and Chen Qian and Siheng Chen},
journal= {arXiv preprint arXiv:2605.10906},
year = {2026}
}