EA-ViT: 弹性视觉 Transformer 的高效适配
计算机视觉与模式识别
2025-07-28 v1
摘要
视觉 Transformer(ViT)已成为计算机视觉中的基础模型,在泛化和适应下游任务方面表现出色。然而,部署 ViT 以支持多样化的资源约束通常需要重新训练多个特定大小的 ViT,这既耗时又耗能。为了解决这个问题,我们提出了一个高效的 ViT 适配框架,该框架能够通过一次适配过程生成多个不同大小的模型,以部署在具有各种资源约束的平台上。我们的方法包括两个阶段。在第一阶段,我们通过一个嵌套的弹性架构增强预训练的 ViT,该架构在 MLP 扩展比、注意力头数、嵌入维度和网络深度方面实现了结构灵活性。为了保留预训练知识并确保稳定适配,我们采用了一种基于课程学习的训练策略,逐步增加弹性。在第二阶段,我们设计了一个轻量级路由器,根据计算预算和下游任务需求选择子模型。该路由器通过定制的 NSGA-II 算法导出的帕累托最优配置进行初始化,然后与主干网络联合优化。在多个基准测试上的大量实验证明了 EA-ViT 的有效性和多功能性。代码可在 https://github.com/zcxcf/EA-ViT 获取。
引用
@article{arxiv.2507.19360,
title = {EA-ViT: Efficient Adaptation for Elastic Vision Transformer},
author = {Chen Zhu and Wangbo Zhao and Huiwen Zhang and Samir Khaki and Yuhao Zhou and Weidong Tang and Shuo Wang and Zhihang Yuan and Yuzhang Shang and Xiaojiang Peng and Kai Wang and Dawei Yang},
journal= {arXiv preprint arXiv:2507.19360},
year = {2025}
}
备注
Published as a conference paper at ICCV 2025