GradViT:视觉 Transformer 的梯度反演
计算机视觉与模式识别
2022-03-29 v3 人工智能
密码学与安全
分布式、并行与集群计算
机器学习
摘要
在本工作中,我们展示了视觉 Transformer(ViT)对基于梯度的反演攻击的脆弱性。在此攻击中,给定模型权重及相应梯度,可重建原始数据批次。我们引入一种名为 GradViT 的方法,通过迭代过程将随机噪声优化为自然观感的图像。优化目标包括(i)匹配梯度的损失,(ii)以预训练 CNN 模型的批归一化统计距离形式给出的图像先验,以及(iii)对图像块的总变分正则化以引导正确的恢复位置。我们提出一种独特的损失调度函数以克服优化中的局部极小。我们在 ImageNet1K 与 MS-Celeb-1M 数据集上评估 GradViT,观察到前所未有的高保真度及与原始(隐藏)数据的接近度。在分析过程中我们发现,由于注意力机制的存在,视觉 Transformer 比先前研究的 CNN 显著更脆弱。我们的方法在定性与定量指标上展示了梯度反演的新 SOTA 结果。项目页面见 https://gradvit.github.io/。
引用
@article{arxiv.2203.11894,
title = {GradViT: Gradient Inversion of Vision Transformers},
author = {Ali Hatamizadeh and Hongxu Yin and Holger Roth and Wenqi Li and Jan Kautz and Daguang Xu and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2203.11894},
year = {2022}
}
备注
CVPR'22 Accepted Paper