中文

TAP-ViTs:面向移动端部署的视觉变换器任务自适应剪枝

计算机视觉与模式识别 2026-01-07 v1 人工智能 机器学习

摘要

视觉变换器(ViT)在广泛的视觉任务中表现出强大的性能,但其巨大的计算和内存需求阻碍了在资源受限的移动和边缘设备上的高效部署。剪枝已成为降低 ViT 复杂度的有前景方法之一。然而,现有方法要么产生面向所有设备的单一修剪模型,忽略了设备异构性,要么依赖于使用设备本地数据进行微调,这些数据常常不可行,due to limited on-device resources and strict privacy constraints。因此,当前方法不足以在隐私保护的移动计算环境中实现任务定制化的 ViT 剪枝。本文引入 TAP-ViTs,一种 novel task-adaptive pruning 框架,用于在不访问任何原始本地数据的情况下生成面向每个设备的特定修剪 ViT 模型。具体而言,为了在隐私约束下推断设备层面的任务特征,我们提出了一种基于高斯混合模型(GMM)的 metric dataset 构建机制。每个设备拟合一个轻量级 GMM 来近似其私有数据分布,仅上传 GMM 参数。利用这些参数,云端从公共数据中选择与分布一致的样本,用于为每个设备构建具有代表性的 metric dataset。基于此代理数据集,我们进一步开发了基于双层级重要性评估的剪枝策略,该策略联合测度复合神经元重要性和自适应层级重要性,从而实现针对每个设备计算预算的细粒度、任务感知的剪枝。广泛的实验表明,TAP-ViTs 在可比压缩比率下 consistently优于最先进的剪枝方法。

关键词

引用

@article{arxiv.2601.02437,
  title  = {TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers},
  author = {Zhibo Wang and Zuoyuan Zhang and Xiaoyi Pang and Qile Zhang and Xuanyi Hao and Shuguo Zhuo and Peng Sun},
  journal= {arXiv preprint arXiv:2601.02437},
  year   = {2026}
}