中文

利用生成数据提升鲁棒性

机器学习 2021-12-15 v2 计算机视觉与模式识别 机器学习

摘要

近期的研究表明,鲁棒训练所需的数据集规模远大于标准分类所需的规模。在 CIFAR-10 和 CIFAR-100 上,这表现为仅在原始训练集数据上训练的模型与使用从“8000万张微小图像”数据集(TI-80M)中提取的额外数据训练的模型之间存在显著的鲁棒精度差距。在本文中,我们探讨了如何利用仅在原始训练集上训练的生成模型来人为增加原始训练集的规模,并提升针对 p\ell_p 范数有界扰动的对抗鲁棒性。我们确定了引入额外生成数据可以提升鲁棒性的充分条件,并证明有可能显著缩小与使用额外真实数据训练的模型之间的鲁棒精度差距。令人惊讶的是,我们甚至证明了即使加入非真实的随机数据(通过高斯采样生成)也能提升鲁棒性。我们在 CIFAR-10、CIFAR-100、SVHN 和 TinyImageNet 上评估了我们的方法,分别应对大小为 ϵ=8/255\epsilon = 8/255ϵ=128/255\epsilon = 128/255\ell_\infty2\ell_2 范数有界扰动。与先前最先进的方法相比,我们在鲁棒精度上取得了巨大的绝对提升。针对大小为 ϵ=8/255\epsilon = 8/255\ell_\infty 范数有界扰动,我们的模型在 CIFAR-10 和 CIFAR-100 上分别取得了 66.10% 和 33.49% 的鲁棒精度(较最先进方法分别提升 +8.96% 和 +3.29%)。针对大小为 ϵ=128/255\epsilon = 128/2552\ell_2 范数有界扰动,我们的模型在 CIFAR-10 上取得了 78.31% 的精度(+3.81%)。这些结果击败了大多数使用外部数据的先前工作。

关键词

引用

@article{arxiv.2110.09468,
  title  = {Improving Robustness using Generated Data},
  author = {Sven Gowal and Sylvestre-Alvise Rebuffi and Olivia Wiles and Florian Stimberg and Dan Andrei Calian and Timothy Mann},
  journal= {arXiv preprint arXiv:2110.09468},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021; Added ImageNet results