AdaptGuard:防御针对模型自适应的通用攻击
密码学与安全
2023-11-28 v2 计算机视觉与模式识别
机器学习
摘要
模型自适应旨在仅访问预训练源模型的约束下解决领域迁移问题。随着对数据隐私和传输效率的日益关注,该范式近期获得了广泛关注。本文研究了由于恶意提供者的存在,在模型自适应算法中从源域迁移而来的通用攻击的脆弱性。我们将通用对抗扰动和后门攻击作为源端的漏洞进行了探索,发现它们在自适应后仍存活于目标模型中。为解决此问题,我们提出了一个名为 AdaptGuard 的模型预处理框架,以提高模型自适应算法的安全性。AdaptGuard 通过知识蒸馏避免直接使用有风险的源参数,并利用调整半径下的伪对抗样本增强鲁棒性。AdaptGuard 是一个即插即用模块,既不需要鲁棒的预训练模型,也不需要对后续模型自适应算法进行任何更改。在三个常用数据集和两种流行自适应方法上的大量结果验证了 AdaptGuard 能够有效防御通用攻击,同时保持目标域的干净准确率。我们希望本研究能为迁移学习的安全性和鲁棒性提供启示。代码可在 https://github.com/TomSheng21/AdaptGuard 获取。
引用
@article{arxiv.2303.10594,
title = {AdaptGuard: Defending Against Universal Attacks for Model Adaptation},
author = {Lijun Sheng and Jian Liang and Ran He and Zilei Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2303.10594},
year = {2023}
}
备注
ICCV2023