注意力提示调优:用于时空建模的预训练模型参数高效适配方法
计算机视觉与模式识别
2024-03-12 v1
摘要
本文提出注意力提示调优(Attention Prompt Tuning, APT)——一种针对视频应用(如动作识别)的计算高效提示调优变体。提示调优方法通过在微调期间注入一组可学习的提示以及数据标记,同时保持主干网络冻结,从而大幅降低可学习参数的数量。对于基于图像的下游任务,仅需少量可学习提示即可接近完整调优的结果。然而,视频因包含更复杂的时空信息,需要数百个可调节的提示才能获得理想的性能。这会降低图像中观察到的参数效率,并显著增加推理期间的延迟和浮点运算量(FLOPs)。为解决这些问题,我们直接将提示注入变换器模块中非局部注意力机制的键和值中。此外,我们引入一种新颖的提示重参数化技术,使APT在超参数选择方面更具鲁棒性。所提出的APT方法显著降低了FLOPs和延迟,同时在UCF101、HMDB51和SSv2数据集上实现了对现有参数高效调优方法的显著性能提升。代码和预训练模型可在 https://github.com/wgcban/apt 获取。
引用
@article{arxiv.2403.06978,
title = {Attention Prompt Tuning: Parameter-efficient Adaptation of Pre-trained Models for Spatiotemporal Modeling},
author = {Wele Gedara Chaminda Bandara and Vishal M. Patel},
journal= {arXiv preprint arXiv:2403.06978},
year = {2024}
}
备注
Accepted at 18th IEEE International Conference on Automatic Face and Gesture Recognition (FG'24) Code available at: https://github.com/wgcban/apt 12 pages, 8 figures, 6 tables