中文

数据表不足:用于自动化质量指标与问责制的 DataRubrics

机器学习 2025-06-04 v2 人工智能 计算与语言 计算机视觉与模式识别 音频与语音处理

摘要

高质量数据集是训练和评估机器学习模型的基础,然而其创建——尤其是具有准确人工标注的数据集——仍然是一项重大挑战。许多数据集论文投稿缺乏原创性、多样性或严格的质量控制,而这些缺陷在同行评审中常被忽视。投稿还经常省略有关数据集构建和属性的基本细节。虽然数据表等现有工具旨在提高透明度,但它们主要是描述性的,没有提供标准化、可量化的数据质量评估方法。同样,会议的元数据要求促进了问责制,但执行情况不一致。为了解决这些局限性,本立场论文主张将系统的、基于评分标准的评估指标整合到数据集评审过程中——尤其是在投稿量持续增长的情况下。我们还探索了可扩展、低成本的合成数据生成方法,包括专用工具和 LLM-as-a-judge 方法,以支持更高效的评估。作为行动呼吁,我们引入了 DataRubrics,这是一个用于评估人工生成和模型生成数据集质量的结构化框架。利用基于 LLM 评估的最新进展,DataRubrics 为数据集质量评估提供了一种可复现、可扩展且可操作的解决方案,使作者和评审者都能在以数据为中心的研究中坚持更高的标准。我们还发布了代码以支持基于 LLM 评估的可复现性,网址为 https://github.com/datarubrics/datarubrics。

关键词

引用

@article{arxiv.2506.01789,
  title  = {Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability},
  author = {Genta Indra Winata and David Anugraha and Emmy Liu and Alham Fikri Aji and Shou-Yi Hung and Aditya Parashar and Patrick Amadeus Irawan and Ruochen Zhang and Zheng-Xin Yong and Jan Christian Blaise Cruz and Niklas Muennighoff and Seungone Kim and Hanyang Zhao and Sudipta Kar and Kezia Erina Suryoraharjo and M. Farid Adilazuarda and En-Shiun Annie Lee and Ayu Purwarianti and Derry Tanti Wijaya and Monojit Choudhury},
  journal= {arXiv preprint arXiv:2506.01789},
  year   = {2025}
}

备注

Preprint