中文

面向低资源视觉学习的视觉 Transformer 压缩

计算机视觉与模式识别 2023-09-07 v1 机器学习

摘要

视觉 Transformer(ViT)及其变体已横扫视觉学习排行榜,并通过关注视觉输入的不同部分、捕捉长程空间依赖,在图像分类、目标检测和语义分割等任务中提供最先进的精度。然而,这些模型规模大且计算繁重。例如,近期提出的 ViT-B 模型拥有 86M 参数,使其难以部署在资源受限设备上。因此,它们在移动和边缘场景中的部署受到限制。在我们的工作中,我们利用蒸馏、剪枝和量化等流行的模型压缩技术,朝着将视觉 Transformer 引入边缘迈进一步。我们选定的应用环境是一架由电池供电、内存受限的无人机(UAV),其搭载如 NVIDIA Jetson Nano(4GB RAM)级别的单板计算机。另一方面,无人机需要接近最先进 ViTs 的高精度,以确保自主导航中的安全避障或搜救中人员的正确定位。鉴于应用需求,推理延迟也应最小化。因此,我们的目标是在精度损失最小的情况下,于 NVIDIA Jetson Nano(4GB)上实现视觉 Transformer 的快速推理。这使我们能将 ViTs 部署在资源受限设备上,为监控、环境监测等开辟新可能。我们的实现发布于 https://github.com/chensy7/efficient-vit。

关键词

引用

@article{arxiv.2309.02617,
  title  = {Compressing Vision Transformers for Low-Resource Visual Learning},
  author = {Eric Youn and Sai Mitheran J and Sanjana Prabhu and Siyuan Chen},
  journal= {arXiv preprint arXiv:2309.02617},
  year   = {2023}
}