大数据时代的小数据挑战:无监督与半监督方法近期进展综述
计算机视觉与模式识别
2021-01-05 v2
摘要
由于深度神经网络的成功往往依赖于大量昂贵标注数据的可用性,带有少量标注数据的表示学习已在许多问题中涌现。为此,人们做出了诸多努力,以无监督和半监督方式用极少标注数据训练复杂模型。本文中,我们将综述这两大类方法的近期进展。广泛的模型将在一幅全局图景中被归类,其中我们将展示它们如何相互交织以启发新思想的探索。我们将综述学习变换等变、解耦、自监督与半监督表示的原理,这些均支撑了近期进展的基础。许多无监督与半监督生成模型的实现基于这些准则被开发,通过探索无标注数据的分布以获更强表示,极大地拓展了现有自编码器、生成对抗网络(GANs)及其他深度网络的疆域。我们将通过揭示无监督与半监督学习间的内在联系来讨论新兴主题,并提出未来方向以弥合无监督学习的变换等变性与有监督学习的有监督不变性之间的算法与理论鸿沟,并统一无监督预训练与有监督微调。我们还将提供更广阔的未来展望,以统一表示学习的变换与实例等变性,连接无监督与半监督增强,并探索自监督正则化在许多学习问题中的作用。
引用
@article{arxiv.1903.11260,
title = {Small Data Challenges in Big Data Era: A Survey of Recent Progress on Unsupervised and Semi-Supervised Methods},
author = {Guo-Jun Qi and Jiebo Luo},
journal= {arXiv preprint arXiv:1903.11260},
year = {2021}
}
备注
published in IEEE Transactions on Pattern Analysis and Machine Intelligence