中文

鲁棒主动学习:鲁棒深度学习模型的高效样本训练

机器学习 2021-12-07 v1 人工智能

摘要

主动学习是一种成熟技术,用于降低构建高质量机器学习模型的标注成本。主动学习的核心组件是确定应选择哪些数据进行标注的采集函数。最先进的采集函数——以及更广泛的主动学习技术——旨在最大化干净性能(如准确率),而忽视了鲁棒性这一日益受到关注的重要质量属性。因此,主动学习产生的模型准确但不鲁棒。本文中,我们提出鲁棒主动学习,一种将对抗训练(最成熟的鲁棒模型生成方法)整合进来的主动学习过程。通过对11种采集函数、4个数据集、6种DNN架构以及15105个已训练DNN的经验研究,我们表明鲁棒主动学习能产生鲁棒性(对抗样本上的准确率)介于2.35%至63.85%的模型,而标准主动学习系统性地实现可忽略的鲁棒性(小于0.20%)。然而,我们的研究还揭示,在准确率上表现良好的采集函数在鲁棒性方面劣于随机采样。因此我们审视其背后原因,并设计了一种同时针对干净性能与鲁棒性的新采集函数。我们的采集函数——名为基于密度的鲁棒熵采样(DRE)——在鲁棒性上超越其他采集函数(包括随机)至多24.40%(尤其比随机高3.84%),同时在准确率上保持竞争力。此外,我们证明DRE可作为模型重训练的测试选择度量,并在鲁棒性上以至多8.21%优于所有对比函数。

关键词

引用

@article{arxiv.2112.02542,
  title  = {Robust Active Learning: Sample-Efficient Training of Robust Deep Learning Models},
  author = {Yuejun Guo and Qiang Hu and Maxime Cordy and Mike Papadakis and Yves Le Traon},
  journal= {arXiv preprint arXiv:2112.02542},
  year   = {2021}
}

备注

10 pages