Croissant Baker:为可发现、可治理且可重用的 ML 数据集生成元数据
机器学习
2026-05-15 v1 数据库
数字图书馆
信息检索
摘要
Croissant 已成为机器学习数据集的元数据标准,提供基于 JSON-LD 的结构化格式,使数据集发现、自动摄取和可重复分析在 ML 平台间具备机器可检验性。采用正在加速,NeurIPS 现在要求其数据集轨道的每一次提交都包含 Croissant 元数据。然而实际情况下,Croissant 的生成通常从上传数据到公共平台开始,而这对于持有大量高价值数据的受管管本地存储库(这些存储库是 ML 日益依赖的数据来源)来说是不可行的。我们发布了 Croissant Baker,一个本地优先、开源的命令行工具,可通过模块化处理器注册表直接从数据集目录生成经过验证的 Croissant 元数据。我们对 Croissant Baker 在超过 140 个数据集上进行了评估,规模扩展到 8860 万行和 374 个 Parquet 文件。对于持留组与生产者编写的或从标准派生的基准真值之间的持留组比较,Croissant Baker 在多个领域中达到 97-100% 的一致性。
引用
@article{arxiv.2605.15079,
title = {Croissant Baker: Metadata Generation for Discoverable, Governable, and Reusable ML Datasets},
author = {Rafi Al Attrach and Rajna Fani and Sebastian Lobentanzer and Joan Giner-Miguelez and Debanshu Das and Varuni H. K. and Nobin Sarwar and Rajat Ghosh and Anwai Archit and Surbhi Motghare and Christina Conrad Parry and Luis Oala and Lara Grosso and Joaquin Vanschoren and Steffen Vogler and Sujata Goswami and Eric S. Rosenthal and Marzyeh Ghassemi and Matthew McDermott and Tom Pollard},
journal= {arXiv preprint arXiv:2605.15079},
year = {2026}
}
备注
23 pages, 5 figures, 11 tables. Project: https://lcp.mit.edu/croissant-baker/ Code: https://github.com/MIT-LCP/croissant-baker