无需微调加速大规模视觉Transformer用于密集预测
计算机视觉与模式识别
2022-10-04 v1 机器学习
摘要
视觉Transformer近期在各种视觉任务上取得了有竞争力的结果,但在处理大量token时仍面临沉重的计算成本。许多先进方法已被提出用于减少大规模视觉Transformer中的token总数,尤其是针对图像分类任务。通常,它们根据token与类token的相关性选择一小部分关键token,然后微调视觉Transformer的权重。由于比图像分类计算量和GPU内存成本高得多,此类微调对密集预测而言不太实用。本文关注一个更具挑战性的问题,即在不进行任何额外重训练或微调的情况下,加速大规模视觉Transformer用于密集预测。针对密集预测需要高分辨率表征这一事实,我们提出两个非参数算子:一个用于减少token数量的token聚类层,以及一个用于增加token数量的token重建层。为实现此目的执行以下步骤:(i)我们使用token聚类层将相邻token聚类在一起,得到保持空间结构的低分辨率表征;(ii)我们仅对这些低分辨率表征或聚类后的token应用后续的Transformer层;(iii)我们使用token重建层从精炼后的低分辨率表征重新生成高分辨率表征。我们的方法在五项密集预测任务上结果令人鼓舞,包括目标检测、语义分割、全景分割、实例分割和深度估计。
引用
@article{arxiv.2210.01035,
title = {Expediting Large-Scale Vision Transformer for Dense Prediction without Fine-tuning},
author = {Weicong Liang and Yuhui Yuan and Henghui Ding and Xiao Luo and Weihong Lin and Ding Jia and Zheng Zhang and Chao Zhang and Han Hu},
journal= {arXiv preprint arXiv:2210.01035},
year = {2022}
}
备注
Accepted at NeurIPS 2022, camera-ready version, 22 pages, 14 figures