中文

对抗性图像混淆的鲁棒性基准测试

计算机视觉与模式识别 2023-12-01 v2 机器学习

摘要

自动化内容过滤与审核是一种重要工具,使在线平台能够构建繁荣的用户社区,促进合作并防止滥用。遗憾的是,资源充足的行动者试图绕过自动化过滤器,以发布违反平台政策和行为准则的内容。为实现这一目标,这些恶意行动者可能对违规图像进行混淆(例如,用精心挑选的良性图像或视觉图案叠加有害图像),以防止机器学习模型做出正确判断。在本文中,我们邀请研究人员解决这一特定问题,并提出一个新的图像基准。该基准基于 ImageNet,模拟恶意行动者所创建的混淆类型。它超越了 ImageNet-C\textrm{C} 和 ImageNet-Cˉ\bar{\textrm{C}},提出了保留原始内容意图的通用、剧烈、对抗性修改。其旨在应对比 p\ell_p 范数有界对抗者所考虑的更为常见的对抗性威胁。我们在该基准上评估了 33 个预训练模型,并使用不同的增强、架构和训练方法在混淆子集上训练模型以衡量泛化能力。我们希望该基准能鼓励研究人员测试其模型与方法,并尝试寻找对这些混淆更具鲁棒性的新方法。

关键词

引用

@article{arxiv.2301.12993,
  title  = {Benchmarking Robustness to Adversarial Image Obfuscations},
  author = {Florian Stimberg and Ayan Chakrabarti and Chun-Ta Lu and Hussein Hazimeh and Otilia Stretcu and Wei Qiao and Yintao Liu and Merve Kaya and Cyrus Rashtchian and Ariel Fuxman and Mehmet Tek and Sven Gowal},
  journal= {arXiv preprint arXiv:2301.12993},
  year   = {2023}
}