Pro-tuning:面向视觉任务的统一提示微调
计算机视觉与模式识别
2022-08-24 v3
摘要
在计算机视觉中,微调是利用预训练视觉模型执行下游任务的事实标准方法。然而,在实际部署中颇具挑战,原因在于采用参数低效的全局更新且高度依赖高质量下游数据。近来,基于提示的学习通过添加任务相关提示使下游任务适配预训练模型,极大提升了诸多自然语言下游任务的性能。本工作中,我们将这一得益于提示的显著迁移能力引入视觉模型,作为微调的替代方案。为此,我们提出参数高效的提示微调(Pro-tuning)以将冻结的视觉模型适配至各类下游视觉任务。Pro-tuning的关键在于基于提示的调优,即在预训练模型冻结的情况下,为下游输入图像学习特定任务的视觉提示。仅训练少量额外参数,即可在多种基于CNN和基于Transformer的架构上工作。大量实验证明,Pro-tuning在广泛的视觉任务与场景中优于微调,包括图像分类(通用物体、类别不平衡、图像损坏、对抗鲁棒性及分布外泛化)以及密集预测任务如目标检测与语义分割。
引用
@article{arxiv.2207.14381,
title = {Pro-tuning: Unified Prompt Tuning for Vision Tasks},
author = {Xing Nie and Bolin Ni and Jianlong Chang and Gaomeng Meng and Chunlei Huo and Zhaoxiang Zhang and Shiming Xiang and Qi Tian and Chunhong Pan},
journal= {arXiv preprint arXiv:2207.14381},
year = {2022}
}