中文

视觉查询微调:面向参数与内存高效的迁移学习中中间表征的有效利用

机器学习 2023-04-28 v2 人工智能 计算机视觉与模式识别

摘要

预训练模型的中间特征已被证明对下游任务做出准确预测具有信息量,即使模型主干被保持冻结。关键挑战在于如何在这些海量中间特征面前加以利用。我们提出视觉查询微调(VQT),一种简单而有效的方法来聚合视觉变换器(Vision Transformers)的中间特征。通过在每一层引入少量可学习的“查询”令牌,VQT 利用变换器的内部机制来“总结”每一层的丰富中间特征,随后可用于训练下游任务的预测头。由于 VQT 保持中间特征不变且仅学习组合它们,与许多学习适配特征并需通过整个主干反向传播的参数高效微调方法相比,它在训练中具有内存高效性。这也暗示了 VQT 与那些方法在迁移学习中的互补作用。在经验上,VQT 一致超越利用中间特征进行迁移学习的现有最优方法,并在许多情况下优于全量微调。与适配特征的参数高效方法相比,VQT 在内存约束下实现了高得多的准确率。最重要的是,VQT 与这些方法兼容,以获得更高准确率,使其成为进一步助推迁移学习的简单附加模块。

关键词

引用

@article{arxiv.2212.03220,
  title  = {Visual Query Tuning: Towards Effective Usage of Intermediate Representations for Parameter and Memory Efficient Transfer Learning},
  author = {Cheng-Hao Tu and Zheda Mai and Wei-Lun Chao},
  journal= {arXiv preprint arXiv:2212.03220},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Cheng-Hao Tu and Zheda Mai contributed equally to this work