人类不可感知攻击及其在改善公平性中的应用
计算机视觉与模式识别
2021-12-01 v1
摘要
现代神经网络在众多涉及对象分类与图像生成的任务中至少能达到与人类相当的性能。然而,人类不可感知的微小扰动可能显著削弱训练良好的深度神经网络的性能。我们提供了一种分布鲁棒优化(DRO)框架,该框架结合基于人类图像质量评估的方法来设计对人类不可感知但对深度神经网络极具破坏性的最优攻击。通过大量实验,我们表明我们的攻击算法比其他最先进的人类不可感知攻击方法生成质量更好(对人类更不可感知)的攻击。此外,我们证明使用我们最优设计的人类不可感知攻击进行 DRO 训练可改善图像分类中的群体公平性。文末,我们提供了一种算法实现以显著加速 DRO 训练,这本身可能具有独立价值。
引用
@article{arxiv.2111.15603,
title = {Human Imperceptible Attacks and Applications to Improve Fairness},
author = {Xinru Hua and Huanzhong Xu and Jose Blanchet and Viet Nguyen},
journal= {arXiv preprint arXiv:2111.15603},
year = {2021}
}