用于冻结视觉Transformer输入空间适应的提示生成网络
计算机视觉与模式识别
2024-09-04 v3
摘要
随着transformer架构在计算机视觉中的引入,增大模型规模已被证明是获得性能与鲁棒性提升的明确途径。然而,当模型参数量达到数十亿时,经典的微调方法正变得日益受限,甚至在模型作为推理API托管时(如NLP中)变得不可行。视觉输入提示学习是一种适应技术,其学习视觉(RGB)空间中的附加输入,已成为适应冻结及云端托管模型的潜在方案,既不需要前向传播权限,也不需要后处理。但迄今为止,这些限制已显著恶化了适应性能。为此,我们提出提示生成网络(PGN),其为每个数据点生成不同的提示,并用于使冻结的预训练视觉模型适应目标任务。我们表明PGN能有效将预训练模型适应到多个新数据集:在12/12个数据集上大幅超越先前方法,甚至在5/12上优于全微调,同时所需参数少100倍。最后,我们引入“提示反演”技巧,使PGN能在潜空间高效训练,但在RGB输入空间部署推理。
引用
@article{arxiv.2210.06466,
title = {Prompt Generation Networks for Input-Space Adaptation of Frozen Vision Transformers},
author = {Jochem Loedeman and Maarten C. Stol and Tengda Han and Yuki M. Asano},
journal= {arXiv preprint arXiv:2210.06466},
year = {2024}
}
备注
Accepted by BMVC2024. Codebase: https://github.com/jochemloedeman/PGN