Clip4Retrofit:通过跨架构 CLIP 蒸馏实现在边缘设备上的实时图像标注
计算机视觉与模式识别
2025-05-26 v1
摘要
CLIP(Contrastive Language-Image Pretraining)等基础模型通过跨模态对齐实现了零样本和少样本学习,从而彻底改变了视觉语言任务。然而,其计算复杂度和巨大的内存占用使其不适合部署在资源受限的边缘设备上,例如用于图像采集和实时处理的车载摄像头。为应对这一挑战,我们提出了 Clip4Retrofit,一个高效的模型蒸馏框架,可在边缘设备上实现实时图像标注。该框架部署在 Retrofit 摄像头中,这是一种低成本边缘设备,已被改装到数千辆车辆中,尽管在计算性能和内存方面存在严格限制。我们的方法将 CLIP 模型的知识蒸馏到一个轻量级学生模型中,将 EfficientNet-B3 与多层感知机(MLP)投影头相结合,在显著降低计算需求的同时保持了跨模态对齐。我们证明蒸馏后的模型在效率与性能之间取得了平衡,使其非常适合部署在现实场景中。实验结果表明,Clip4Retrofit 可以在资源有限的边缘设备上执行实时图像标注和目标识别,为自动驾驶和现有系统改装等应用提供了切实可行的解决方案。本工作弥清了最先进视觉语言模型与其在资源受限环境中部署之间的差距,为基础模型在边缘计算中的更广泛应用铺平了道路。
引用
@article{arxiv.2505.18039,
title = {Clip4Retrofit: Enabling Real-Time Image Labeling on Edge Devices via Cross-Architecture CLIP Distillation},
author = {Li Zhong and Ahmed Ghazal and Jun-Jun Wan and Frederik Zilly and Patrick Mackens and Joachim E. Vollrath and Bogdan Sorin Coseriu},
journal= {arXiv preprint arXiv:2505.18039},
year = {2025}
}