中文

优化机器学习的数据收集

机器学习 2022-10-05 v1 人工智能 计算机视觉与模式识别

摘要

现代深度学习系统需要海量数据集以实现令人印象深刻的性能,但关于应收集多少或何种数据却鲜有指导。过度收集数据产生不必要的当前成本,而收集不足可能导致未来成本与工作流程延迟。我们提出一种新范式,将数据收集工作流建模为形式化的最优数据收集问题,允许设计者指定性能目标、收集成本、时间范围以及未达目标的惩罚。此外,该表述推广到需要多数据源的任务,如半监督学习中使用的有标签与无标签数据。为求解该问题,我们开发了 Learn-Optimize-Collect(LOC),其最小化期望未来收集成本。最后,我们在数值上将我们的框架与通过神经缩放律外推估计数据需求的常规基线比较。我们在若干分类、分割与检测任务上显著降低了未达预期性能目标的风险,同时保持了较低的总收集成本。

关键词

引用

@article{arxiv.2210.01234,
  title  = {Optimizing Data Collection for Machine Learning},
  author = {Rafid Mahmood and James Lucas and Jose M. Alvarez and Sanja Fidler and Marc T. Law},
  journal= {arXiv preprint arXiv:2210.01234},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022