计算机视觉中的数据现状:人类标注对于开发深度学习模型仍不可或缺
计算机视觉与模式识别
2021-08-03 v1 人工智能
摘要
高质量的标注数据集在推动机器学习(ML),特别是深度学习(DL)的发展中起着至关重要的作用。然而,自2012年ImageNet数据集和AlexNet模型出现以来,新的开源标注视觉数据集的规模大致保持不变。因此,计算机视觉界仅有少数出版物研究在比ImageNet大数个数量级的数据集上进行监督学习。在本文中,我们调研了研究此类大型数据集对不同视觉任务中模型性能影响的计算机视觉研究领域。我们总结了学界目前对这些影响的理解,并强调了与大规模数据集训练相关的一些开放问题。具体而言,我们探讨了:(a) 当前计算机视觉研究中使用的最大数据集以及在此类数据集上训练的有趣启示;(b) 在大型数据集上预训练的有效性;(c) 合成数据集最近的进展与面临的障碍;(d) 双下降与样本非单调性现象的概述;以及最后,(e) 对终身/持续学习的简要讨论,以及其与在离线环境下从海量标注数据集学习相比的表现。总体而言,我们的发现是:深度学习优化研究聚焦于完善训练流程,从而使DL模型对数据的需求降低,而合成数据集研究旨在抵消数据标注的成本。然而,就目前而言,获取非合成标注数据对于提升性能仍不可或缺。
引用
@article{arxiv.2108.00114,
title = {On The State of Data In Computer Vision: Human Annotations Remain Indispensable for Developing Deep Learning Models},
author = {Zeyad Emam and Andrew Kondrich and Sasha Harrison and Felix Lau and Yushi Wang and Aerin Kim and Elliot Branson},
journal= {arXiv preprint arXiv:2108.00114},
year = {2021}
}