中文

利用图像到图像翻译的泛化性提升对抗性防御

计算机视觉与模式识别 2025-04-03 v1 机器学习

摘要

在人工智能快速演化的领域中,机器学习作为一种具有广泛潜力和内在风险的关键技术。其稳定性和可靠性至关重要,因为它们常是安全威胁的目标。对抗性攻击首次由Ian Goodfellow等人于2013年严格定义,凸显了关键脆弱性:它们可以通过几乎不可见的图像扰动来欺骗机器学习模型,使其作出错误预测。尽管许多研究聚焦于构建复杂的防御机制以缓解此类攻击,但往往忽视了训练和维护这些模型的巨大时间和计算成本。理想情况下,防御方法应能够以最小开销泛化到各种甚至未知的对抗性攻击。建立在我们先前基于图像到图像翻译防御的工作基础上,本研究引入改进模型,包含残差块以提升泛化性。该方法仅需训练单个模型,有效抵御多种攻击类型,并在不同目标模型之间具有良好可迁移性。实验表明,我们的模型可将分类准确率从接近零恢复到平均72%,同时保持与最先进方法的竞争性能。

关键词

引用

@article{arxiv.2504.01399,
  title  = {Leveraging Generalizability of Image-to-Image Translation for Enhanced Adversarial Defense},
  author = {Haibo Zhang and Zhihua Yao and Kouichi Sakurai and Takeshi Saitoh},
  journal= {arXiv preprint arXiv:2504.01399},
  year   = {2025}
}