中文

不加反思地使用表格数据存储库可能损害研究质量

机器学习 2025-03-13 v1

摘要

数据存储库积累了来自各个领域的大量表格数据集。机器学习研究人员正在积极使用这些数据集来评估新方法。因此,数据存储库在表格数据研究中具有重要地位。它们不仅托管数据集,还提供如何在监督学习任务中使用它们的信息。在本文中,我们认为,尽管在可用性方面取得了巨大成就,但不加反思地使用数据存储库中的数据集可能导致了研究质量和科学严谨性的下降。我们以近期著名研究的实例说明了来自 OpenML(一个大型表格数据存储库)的数据集存在问题的使用方式。我们的说明有助于数据存储库的用户避免陷入以下陷阱:(1) 使用次优的模型选择策略,(2) 忽视强基线,以及 (3) 不恰当的预处理。作为回应,我们讨论了数据存储库如何防止数据集的不当使用并成为提高实证研究整体质量基石的可能解决方案。

关键词

引用

@article{arxiv.2503.09159,
  title  = {Unreflected Use of Tabular Data Repositories Can Undermine Research Quality},
  author = {Andrej Tschalzev and Lennart Purucker and Stefan Lüdtke and Frank Hutter and Christian Bartelt and Heiner Stuckenschmidt},
  journal= {arXiv preprint arXiv:2503.09159},
  year   = {2025}
}