中文

面向边缘设备的高效图像描述

计算机视觉与模式识别 2022-12-20 v1

摘要

近年来,图像描述取得了快速进展。然而,对大量内存存储和繁重计算负担的需求阻碍了这些描述模型在移动设备上的部署。主要障碍在于重量级的视觉特征提取器(即目标检测器)和复杂的跨模态融合网络。为此,我们提出了 LightCap,一个面向资源受限设备的轻量级图像描述器。其核心设计建立在最近的 CLIP 模型之上,以实现高效的图像描述。具体来说,一方面,我们利用 CLIP 模型提取紧凑的网格特征,而无需依赖耗时的目标检测器。另一方面,我们通过设计一种新颖的视觉概念提取器和跨模态调制器,将 CLIP 的图像-文本检索设计迁移到图像描述场景中。我们通过顺序蒸馏和集成蒸馏进一步优化了跨模态融合模型和并行预测头。凭借精心设计的架构,我们的模型仅包含 40M 参数,与当前最先进的方法相比,模型大小节省了 75% 以上,FLOPs 节省了 98% 以上。尽管容量较低,我们的模型在主流数据集上仍展现出最先进的性能,例如,在 COCO Karpathy 测试集上取得了 136.6 的 CIDEr 分数。在仅配备单个 CPU 的智能手机上进行测试,所提出的 LightCap 展现出每张图像 188 毫秒的快速推理速度,已准备好用于实际应用。

关键词

引用

@article{arxiv.2212.08985,
  title  = {Efficient Image Captioning for Edge Devices},
  author = {Ning Wang and Jiangrong Xie and Hang Luo and Qinglin Cheng and Jihao Wu and Mingbo Jia and Linlin Li},
  journal= {arXiv preprint arXiv:2212.08985},
  year   = {2022}
}

备注

To appear in AAAI 2023