面向预训练视觉 Transformer 的分段适应
计算机视觉与模式识别
2025-03-04 v1 机器学习
摘要
视觉 Transformer (ViT) 已在大规模数据集上进行广泛预训练,成为基础模型的重要组成部分,使其能够在众多下游任务上实现优异性能。因此,越来越多的人关注如何在不同领域适配预训练 ViT,包括隐私敏感领域,在这些领域中,客户端往往不愿意共享数据。现有的适应方法通常需要直接访问数据,在受限条件下不可行。一个直接的解决方案是将预训练 ViT 发送给客户端进行本地适应,但这会引发模型知识产权保护问题,并增加客户端的计算负担。为此,我们提出了一种新颖的分段适应 (SA) 方法,通过在数据和模型保护之间实现有效的下游适应。SA 受分段学习 (SL) 的启发,将预训练 ViT 分割为前端和后端,仅与客户端共享前端以进行数据表示提取。但与常规 SL 不同,SA 将前端参数替换为低位量化值,防止模型直接暴露。SA 允许客户端对前端和提取的数据表示添加双层噪声,以确保数据保护。因此,SA 集成了数据层面和模型层面的 out-of-distribution 增强,以缓解噪声注入对适应性能的影响。我们的 SA 专注于具有挑战性的 few-shot 适应,并采用 patch 检索数据增强以缓解过拟合。多个数据集上的大量实验表明,SA 在最新方法中具有优势,同时能够防御先进的数据重建攻击,在客户端侧以最小计算成本防止模型泄露。源代码可在 https://github.com/conditionWang/Split_Adaptation 查找。
引用
@article{arxiv.2503.00441,
title = {Split Adaptation for Pre-trained Vision Transformers},
author = {Lixu Wang and Bingqi Shang and Yi Li and Payal Mohapatra and Wei Dong and Xiao Wang and Qi Zhu},
journal= {arXiv preprint arXiv:2503.00441},
year = {2025}
}
备注
This paper has been accepted by CVPR 2025. The first two authors contributed equally