提升对抗鲁棒性是否需要标签数据?
机器学习
2019-12-06 v4 计算机视觉与模式识别
机器学习
摘要
近期研究揭示了一个有趣(且有些令人惊讶)的发现:训练对对抗扰动具有不变性的模型所需的数据集规模,远大于标准分类所需。这一结果是在许多标注数据昂贵的真实应用中部署鲁棒机器学习模型的关键障碍。我们的核心见解是,无标签数据可以作为标注数据训练对抗鲁棒模型的竞争性替代方案。理论上,我们证明在一个简单统计设定下,从无标签数据学习对抗鲁棒模型的样本复杂度与全监督情形相差至多常数因子。在 CIFAR-10 等标准数据集上,一种使用无标签数据的简单无监督对抗训练(UAT)方法相比仅使用 4K 监督样本将鲁棒准确率提升了 21.7%,并捕获了同等数量标注样本所带来的超过 95% 的提升。最后,我们通过使用来自未筛选的 8000 万 Tiny Images 数据集的额外无标签数据,在 CIFAR-10 上针对已知最强攻击将此前最优(state-of-the-art)结果提升了 4%。这表明我们的发现也适用于无标签数据同样未筛选的更现实情形,从而为改进对抗训练开辟了新途径。
引用
@article{arxiv.1905.13725,
title = {Are Labels Required for Improving Adversarial Robustness?},
author = {Jonathan Uesato and Jean-Baptiste Alayrac and Po-Sen Huang and Robert Stanforth and Alhussein Fawzi and Pushmeet Kohli},
journal= {arXiv preprint arXiv:1905.13725},
year = {2019}
}
备注
Appears in the Thirty-Third Annual Conference on Neural Information Processing Systems (NeurIPS 2019)