RetailKLIP:使用度量学习在单GPU上微调OpenCLIP骨干网络实现零售产品图像的零样本分类
计算机视觉与模式识别
2024-01-17 v2
摘要
零售产品或包装杂货商品的图像需要在各种计算机视觉应用中进行分类,例如自助结账商店、供应链自动化和零售执行评估。以往的工作探索了为此目的微调深度模型的方法。但由于微调大型模型甚至预训练骨干网络的线性层需要对分类范围内新增的每个零售产品运行至少几个epoch的梯度下降,因此在现实场景中需要频繁的重新训练。在这项工作中,我们提出以这样一种方式微调CLIP模型的视觉编码器:其嵌入可以轻松用于基于最近邻的分类,同时获得接近或超过完全微调的准确率。基于最近邻的分类器不需要对新产品的增量训练,从而节省了资源和等待时间。
引用
@article{arxiv.2312.10282,
title = {RetailKLIP : Finetuning OpenCLIP backbone using metric learning on a single GPU for Zero-shot retail product image classification},
author = {Muktabh Mayank Srivastava},
journal= {arXiv preprint arXiv:2312.10282},
year = {2024}
}