OpenDataArena:面向后训练数据价值的公平且开放的评估竞技场
人工智能
2025-12-17 v1
摘要
大型语言模型(LLM)的快速演进依赖于后训练数据集的质量和多样性。然而,一个关键二元对仍然存在:尽管模型经过严格评估,但驱动它们的数据集却是黑箱——其组成不透明、来源不明确且缺乏系统性评估。这种不透明性阻碍了可重复性,并遮蔽了数据特征与模型行为之间的因果关系。为弥合这一鸿沟,本文提出OpenDataArena(ODA),一个旨在衡量后训练数据内在价值的整体且开放平台。ODA 建立了一个综合性生态系统,包括四个关键支柱:(i) 统一的训练-评估管道,确保跨 diverse 模型(如 Llama、Qwen)和领域的公平、开放比较;(ii) 多维度评分框架,对数据质量沿数十个不同维度进行轮廓;(iii) 交互式数据血统探索器,用于可视化数据谱系并剖析组成来源;(iv) 完整的开源工具包,涵盖训练、评估和评分,以促进数据研究。对 ODA 进行的大量实验——覆盖超过 120 个后训练数据集跨多个领域,经过 22 个基准测试验证,由 600 多次训练运行和 4000 万数据点处理——揭示了非平凡的洞见。我们的分析发现数据复杂度与任务性能之间存在内在权衡,通过血统追踪识别热门基准中的冗余,并绘制了数据集之间的谱系关系。我们公开所有结果、工具和配置,以民主化高质量数据评估。ODA 旨在从试错数据精选转向以数据中心 AI 为导向的原则科学,为深入研究数据混合规律和基础模型的战略数据组成铺平了道路。
引用
@article{arxiv.2512.14051,
title = {OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value},
author = {Mengzhang Cai and Xin Gao and Yu Li and Honglin Lin and Zheng Liu and Zhuoshi Pan and Qizhi Pei and Xiaoran Shang and Mengyuan Sun and Zinan Tang and Xiaoyang Wang and Zhanping Zhong and Yun Zhu and Dahua Lin and Conghui He and Lijun Wu},
journal= {arXiv preprint arXiv:2512.14051},
year = {2025}
}