中文

视觉模型可通过少样本任务感知压缩实现高效专用化

计算机视觉与模式识别 2023-03-28 v1

摘要

近期的视觉架构与自监督训练方法使得视觉模型极为准确且通用,但带来了巨大的参数与计算开销。在实际场景中,例如相机陷阱,用户资源有限,并可能在一小组特定感兴趣类别的(通常有限的)数据上对预训练模型进行微调。这些用户可能希望使用现代的高精度模型,但往往受限于计算资源。为此,我们提出一个问题:能否将大型通才模型快速压缩为准确且高效的专用模型?对此,我们提出了一种简单而通用的技术,称为少样本任务感知压缩(Few-Shot Task-Aware Compression, TACO)。给定一个在广泛任务上预训练准确的大型视觉模型,例如在 ImageNet-22K 上的分类,TACO 可生成一个在专用任务上准确的较小模型,例如跨车辆类型或动物物种的分类。关键在于,TACO 以少样本方式工作,即仅使用少量任务特定样本,且过程计算开销低。我们在原本训练于 ImageNet、LAION 或 iNaturalist 的高精度 ResNet、ViT/DeiT 和 ConvNeXt 模型上验证 TACO,将其专用化并压缩至多样化的“下游”子任务。TACO 可将现有模型中的非零参数数量相对于原始模型最多减少 20 倍,带来最高 3×\times 的推理加速,同时在专用任务上保持与未压缩模型相当的精度。

关键词

引用

@article{arxiv.2303.14409,
  title  = {Vision Models Can Be Efficiently Specialized via Few-Shot Task-Aware Compression},
  author = {Denis Kuznedelev and Soroush Tabesh and Kimia Noorbakhsh and Elias Frantar and Sara Beery and Eldar Kurtic and Dan Alistarh},
  journal= {arXiv preprint arXiv:2303.14409},
  year   = {2023}
}