Patch 排序:通过学习排序局部 Patch 实现高效 CLIP
计算机视觉与模式识别
2024-12-02 v2 机器学习
摘要
诸如 CLIP 等对比图文预训练模型已展现出对下游任务的显著适应性。然而,由于 Vision Transformer (ViT) 主干的高计算需求,它们面临挑战。当前提升 ViT 效率的策略侧重于剪枝 patch token,但在处理 CLIP 的多模态特性以及识别可实现最大性能的最优 token 子集方面存在不足。为了解决这一问题,我们提出了贪心搜索方法来建立“黄金排序”,并引入了一个专门训练用于近似该排序的轻量级预测器。为了弥补 token 剪枝导致的任何性能下降,我们引入了可学习的视觉 token,以帮助恢复并潜在提升模型的性能。我们的工作对 CLIP 模型 ViT 主干内的 token 剪枝进行了全面且系统的调查。通过我们的框架,我们成功减少了 CLIP ViT 中 40% 的 patch token,同时在七个数据集上仅遭受 0.3 的平均准确率损失。我们的研究为构建在不牺牲性能的前提下更具计算效率的多模态模型奠定了基础,解决了先进视觉-语言模型应用中的一个关键挑战。
引用
@article{arxiv.2409.14607,
title = {Patch Ranking: Efficient CLIP by Learning to Rank Local Patches},
author = {Cheng-En Wu and Jinhong Lin and Yu Hen Hu and Pedro Morgado},
journal= {arXiv preprint arXiv:2409.14607},
year = {2024}
}
备注
Accepted by WACV 2025