面向 Vision Transformers 的带残差的表达式提示学习
计算机视觉与模式识别
2023-03-29 v1
摘要
提示学习是一种高效方法,通过将可学习参数集插入预训练模型的输入与中间表示来适配 transformers。本工作中,我们提出带残差的 expressive prompts(EXPRES),它改进了提示学习范式,以专门有效适配视觉 transformers(ViT)。我们的方法通过可学习的“输出”令牌构建下游表示,这些令牌类似于 ViT 的学习类令牌。进一步,为更好地引导由冻结 transformer 处理的下游表示,我们引入残差可学习令牌,将其加至各类计算的输出上。我们将 EXPRES 应用于图像分类、少样本学习与语义分割,并展示我们的方法能够在 VTAB 基准的 3/3 类上实现最先进的提示调优。除强劲性能外,我们观察到我们的方法比现有视觉提示基线在提示使用上高效一个数量级。我们从解析上展示了相比微调等权重空间适配技术的计算优势。最后,我们通过一系列消融实验系统性地证实了方法的架构设计。
引用
@article{arxiv.2303.15591,
title = {Learning Expressive Prompting With Residuals for Vision Transformers},
author = {Rajshekhar Das and Yonatan Dukler and Avinash Ravichandran and Ashwin Swaminathan},
journal= {arXiv preprint arXiv:2303.15591},
year = {2023}
}
备注
Accepted at CVPR (2023)