中文

AutoSDT:将数据驱动的发现任务扩展至开放型共创科学家

机器学习 2025-06-11 v1 计算与语言

摘要

尽管长期以来一直在努力利用AI加速科学发现,但由于用于训练和评估的高质量数据有限,构建AI共创科学家仍然具有挑战性。为了解决这一数据稀缺问题,我们提出了 AutoSDT,一个在真实世界数据驱动发现工作流中收集高质量编码任务的自动化流水线。AutoSDT 利用 LLMs 的编码能力和参数化知识来搜索多样化来源,选择具有生态效度的任务,并合成准确的指令和代码解决方案。使用我们的流水线,我们构建了 AutoSDT-5K,一个包含 5,404 个数据驱动发现编码任务的数据集,涵盖四个科学学科和 756 个独特的 Python 包。据我们所知,AutoSDT-5K 是唯一自动收集的且最大的用于数据驱动科学发现的开放数据集。对 256 个任务子集的专家反馈显示了 AutoSDT 的有效性:93% 的收集任务具有生态效度,92.2% 的合成程序在功能上是正确的。在 AutoSDT-5K 上训练后,被称为 AutoSDT-Coder 的 Qwen2.5-Coder-Instruct LLM 系列在两个具有挑战性的数据驱动发现基准 ScienceAgentBench 和 DiscoveryBench 上取得了显著提升。最值得注意的是,AutoSDT-Coder-32B 在 ScienceAgentBench 上达到了与 GPT-4o 相同的性能水平,成功率为 7.8%,是其基础模型性能的两倍。在 DiscoveryBench 上,它将假设匹配分数提升至 8.1,带来了 17.4% 的相对提升,缩小了开放权重模型与 GPT-4o 之间的差距。

关键词

引用

@article{arxiv.2506.08140,
  title  = {AutoSDT: Scaling Data-Driven Discovery Tasks Toward Open Co-Scientists},
  author = {Yifei Li and Hanane Nour Moussa and Ziru Chen and Shijie Chen and Botao Yu and Mingyi Xue and Benjamin Burns and Tzu-Yao Chiu and Vishal Dey and Zitong Lu and Chen Wei and Qianheng Zhang and Tianyu Zhang and Song Gao and Xuhui Huang and Xia Ning and Nesreen K. Ahmed and Ali Payani and Huan Sun},
  journal= {arXiv preprint arXiv:2506.08140},
  year   = {2025}
}