无标签数据对抗学习的瓶颈何在?
机器学习
2019-11-21 v1 机器学习
摘要
深度神经网络(DNNs)由于对抗样本而极其脆弱。为增强DNNs的鲁棒性,提出了对抗训练,其需要大规模且标注良好的数据。然而,良好地标注大规模数据十分昂贵。为弥补这一不足,若干开创性工作正利用大规模无标签数据。在本文中,我们观察到开创性工作表现不佳,因为无标签数据上伪标签的质量相当差,尤其当无标签数据量显著大于有标签数据量时。我们认为伪标签的质量是无标签数据对抗学习的瓶颈。为突破该瓶颈,我们借助深度协同训练,即训练两个深度网络并通过利用对方的对抗样本来鼓励两网络发散。基于深度协同训练,我们提出了用于无标签数据对抗学习的鲁棒协同训练(RCT)。我们在CIFAR-10和SVHN数据集上进行了全面实验。实证结果表明,我们的RCT在不同数据集、不同网络结构以及不同类型对抗训练下,在标准测试精度和鲁棒测试精度上均显著优于基线(如鲁棒自训练(RST))。
引用
@article{arxiv.1911.08696,
title = {Where is the Bottleneck of Adversarial Learning with Unlabeled Data?},
author = {Jingfeng Zhang and Bo Han and Gang Niu and Tongliang Liu and Masashi Sugiyama},
journal= {arXiv preprint arXiv:1911.08696},
year = {2019}
}