分布偏移下模型准确性的认证
机器学习
2023-07-18 v3
摘要
机器学习中的认证鲁棒性主要关注对输入的对抗性扰动,且数据分布中每点具有固定攻击预算。在本文中,我们给出了在数据的有界 Wasserstein 偏移下模型准确性的可证明鲁棒性保证。我们表明,一种在变换空间内对模型输入进行随机化的简单过程,在该变换下对分布偏移具有可证明的鲁棒性。我们的框架允许输入分布中不同点上的数据特定扰动大小变化,并且足够通用以包含固定大小的扰动。我们的证书对原始分布周围 Wasserstein 球内任何(自然的或对抗的)输入分布偏移下模型的性能产生有保证的下界。我们将技术应用于:(i)认证对图像自然(非对抗)变换(如颜色偏移、色调偏移以及亮度和饱和度变化)的鲁棒性,(ii)认证对输入分布对抗偏移的鲁棒性,以及(iii)展示在所谓“不可学习”数据集(已被投毒以干扰模型训练)上训练模型的性能可证明下界(困难性结果)。
引用
@article{arxiv.2201.12440,
title = {Certifying Model Accuracy under Distribution Shifts},
author = {Aounon Kumar and Alexander Levine and Tom Goldstein and Soheil Feizi},
journal= {arXiv preprint arXiv:2201.12440},
year = {2023}
}