中文

关于视觉Transformer用于图像恢复时不合理的脆弱性——及一种简易修复方法

计算机视觉与模式识别 2023-07-27 v1 机器学习 图像与视频处理

摘要

在视觉识别任务取得成功之后,Vision Transformers(ViTs,视觉Transformer)正越来越多地用于图像恢复。由于近期一些工作声称用于图像分类的 ViT 也具有更好的鲁棒性特性,我们研究了 ViT 改进的对抗鲁棒性是否延伸到图像恢复。我们考虑了最近提出的 Restormer 模型,以及 NAFNet 和“基线网络”,后两者均为 Restormer 的简化版本。我们使用投影梯度下降(Projected Gradient Descent, PGD)和 CosPGD(一种最近提出的、针对逐像素预测任务的对抗攻击)进行鲁棒性评估。我们的实验在来自 GoPro 数据集的真实世界图像上去模糊任务上执行。我们的分析表明,与图像分类工作中所倡导的 ViT 不同,这些模型极易受到对抗攻击。我们尝试通过对抗训练来提高其鲁棒性。虽然这为 Restormer 带来了鲁棒性的显著提升,但其他网络的结果则不那么乐观。有趣的是,NAFNet 和基线网络中基于独立同分布(iid)性能而非鲁棒泛化得出的设计选择,似乎与模型鲁棒性相悖。因此,我们对此进一步研究并找到了一种修复方法。

关键词

引用

@article{arxiv.2307.13856,
  title  = {On the unreasonable vulnerability of transformers for image restoration -- and an easy fix},
  author = {Shashank Agnihotri and Kanchana Vaishnavi Gandikota and Julia Grabinski and Paramanand Chandramouli and Margret Keuper},
  journal= {arXiv preprint arXiv:2307.13856},
  year   = {2023}
}

备注

Tags: Robustness, adversarial attacks, image deblurring, image restoration, NAFNet, Baseline, Restormer, adversarial training