ViM:用于统一下游迁移的视觉中间件
计算机视觉与模式识别
2023-03-14 v1
摘要
基础模型在海量数据上预训练,并通过微调迁移到下游任务。本文提出视觉中间件(ViM),一种面向从单一基础模型向多种下游任务统一迁移的新学习范式。ViM由一组轻量级插件模块构成,每个模块在中游数据集上借助共享冻结骨干独立学习。得益于从中游任务继承的丰富知识,下游任务可受益于对模块库的充分聚合。此类设计有三大优势。从效率角度看,上游骨干只需训练一次,即可供所有下游任务复用而无需调参。从可扩展性角度看,我们可以轻松向ViM追加额外模块且不影响已有模块。从性能角度看,ViM可纳入尽可能多的中游任务,缩小上下游任务鸿沟。鉴于这些益处,我们相信由社区共同维护与发展的ViM将成为辅助基础模型的强力工具。
引用
@article{arxiv.2303.06911,
title = {ViM: Vision Middleware for Unified Downstream Transferring},
author = {Yutong Feng and Biao Gong and Jianwen Jiang and Yiliang Lv and Yujun Shen and Deli Zhao and Jingren Zhou},
journal= {arXiv preprint arXiv:2303.06911},
year = {2023}
}