闭合数据循环:利用 OpenDataArena 构建优质训练数据集
计算与语言
2026-01-16 v1 人工智能
摘要
监督微调(SFT)数据集的构建是大语言模型(LLM)后训练中一个关键但理论化不足的阶段,因为普遍做法往往依赖于启发式聚合,而缺乏对单个样本如何贡献于模型性能的系统性理解。在本报告中,我们提出了一种范式转变,从临时性筛选转向使用 OpenDataArena (ODA) 的闭环数据集工程框架,该框架利用价值锚定排名和多维分析,将价值基准转化为指导数据集构建的反馈信号。我们通过两个新数据集实例化了这一方法:ODA-Math-460k,一个专门的数学推理数据集,利用新颖的两阶段难度感知流水线,在 AIME 和 HMMT 等基准上取得了最先进(SOTA)的结果;以及 ODA-Mixture (100k & 500k),一系列通过“锚定与修补”策略构建的多领域指令数据集,其性能显著优于规模更大的开源基线。我们的实证结果表明,ODA 驱动的数据集显著提升了特定领域推理和通用能力,同时实现了卓越的数据效率,验证了向以数据为中心的 AI 的转变,其中透明评估是构建高质量训练数据的主要引擎。
引用
@article{arxiv.2601.09733,
title = {Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets},
author = {Xin Gao and Xiaoyang Wang and Yun Zhu and Mengzhang Cai and Conghui He and Lijun Wu},
journal= {arXiv preprint arXiv:2601.09733},
year = {2026}
}
备注
Superior ODA-Math, ODA-Mixture Datasets