深度主动学习综述
机器学习
2021-12-07 v2 机器学习
摘要
主动学习(AL)试图以标注最少样本来最大化模型性能增益。深度学习(DL)贪求数据,需要大量数据供给以优化海量参数,使模型学会如何提取高质量特征。近年来,由于互联网技术的快速发展,我们身处信息洪流时代,拥有海量数据。由此,DL 引起了研究者的强烈兴趣并快速发展。与 DL 相比,研究者对 AL 的兴趣相对较低。这主要是因为 DL 兴起前,传统机器学习所需标注样本较少,因此早期 AL 难以体现其应有价值。尽管 DL 在各领域取得突破,但多数成功得益于现有大量标注数据集的公开。然而,大量高质量标注数据集的获取耗费大量人力,在一些需高专业性的领域(尤其是语音识别、信息抽取、医学图像等领域)并不允许。因此,AL 逐渐受到应有重视。一个自然的想法是能否利用 AL 降低样本标注成本,同时保留 DL 的强大学习能力。于是深度主动学习(DAL)应运而生。尽管相关研究已颇丰富,却缺乏对 DAL 的全面综述。本文旨在填补此空白,我们对现有工作给出形式化分类方法,并提供全面系统的概览。此外,我们还从应用角度对 DAL 的发展进行了分析与总结。最后,我们讨论了 DAL 中的困惑与问题,并给出 DAL 的一些可能发展方向。
引用
@article{arxiv.2009.00236,
title = {A Survey of Deep Active Learning},
author = {Pengzhen Ren and Yun Xiao and Xiaojun Chang and Po-Yao Huang and Zhihui Li and Brij B. Gupta and Xiaojiang Chen and Xin Wang},
journal= {arXiv preprint arXiv:2009.00236},
year = {2021}
}