一项关于“高质量数据是否就是我们所需的一切?”的研究提议
机器学习
2022-03-15 v1 计算与语言
摘要
尽管深度神经模型在许多流行基准上取得了超越人类的性能,但它们未能泛化到 OOD 或对抗性数据集。旨在提高鲁棒性的常规方法包括开发越来越大的模型以及用大规模数据集进行增强。然而,与这些趋势正交,我们假设我们需要的是较小的、高质量的数据集。我们的假设基于深度神经网络是数据驱动的模型,而数据正是引导或误导模型的因素。在这项工作中,我们提出一项实证研究,考察如何为模型有效学习而筛选子集和/或创建高质量基准数据。我们试图回答是否真正需要大数据集来学习任务,以及较小的高质量数据子集能否替代大数据集。我们计划研究数据剪枝和数据创建两种范式以生成高质量数据集。
引用
@article{arxiv.2203.06404,
title = {A Proposal to Study "Is High Quality Data All We Need?"},
author = {Swaroop Mishra and Anjana Arunkumar},
journal= {arXiv preprint arXiv:2203.06404},
year = {2022}
}
备注
NeurIPS 2020 Pre-registration workshop