中文

掩码拼图:一种用于视觉 Transformer 的多功能位置嵌入

计算机视觉与模式识别 2023-05-29 v3 密码学与安全

摘要

位置嵌入(PE)作为视觉 Transformer(ViT)中可谓不可或缺的组件,已被证明能提升 ViT 在许多视觉任务上的性能。然而,PE 存在潜在的严重隐私泄露风险,因为输入图像块的空间信息被暴露。这一隐患自然引发了一系列关于 PE 对准确率、隐私、预测一致性等影响的有趣问题。为应对这些问题,我们提出掩码拼图(MJP)位置嵌入方法。具体而言,MJP 首先通过我们的分块随机拼图洗牌算法对所选图像块进行打乱,并遮挡其对应的 PE。同时,对于未遮挡的图像块,PE 保持原始值,但其空间关系通过我们的稠密绝对定位回归器得到增强。实验结果表明:1) PE 显式编码了二维空间关系,并在梯度反演攻击下导致严重的隐私泄露问题;2) 用朴素打乱的图像块训练 ViT 可缓解该问题,但会损害准确率;3) 在一定的打乱比例下,所提 MJP 不仅在大规模数据集(即 ImageNet-1K 与 ImageNet-C、-A/O)上提升了性能与鲁棒性,还大幅增强了在典型梯度攻击下的隐私保护能力。源代码与训练好的模型见~\url{https://github.com/yhlleo/MJP}。

关键词

引用

@article{arxiv.2205.12551,
  title  = {Masked Jigsaw Puzzle: A Versatile Position Embedding for Vision Transformers},
  author = {Bin Ren and Yahui Liu and Yue Song and Wei Bi and Rita Cucchiara and Nicu Sebe and Wei Wang},
  journal= {arXiv preprint arXiv:2205.12551},
  year   = {2023}
}

备注

Accepted to CVPR2023