基于视觉语言模型的零样态零粒度零售产品分类探索
计算机视觉与模式识别
2024-09-24 v1
摘要
在智能零售应用中,产品数量庞大且频繁更换, necessitating可靠的零样态目标分类方法。零样态假设对于避免每次新产品引入库存或现有产品重新 branding 后重新训练分类器至关重要。本文作出三个关键贡献。首先,我们引入MIMEX数据集,包含28个不同的产品类别。与文献中现有数据集不同,MIMEX侧重于零粒度产品分类,并包含多样化的零售产品。其次,我们对比评估了最先进视觉语言模型(VLMs)在所提MIMEX数据集上的零样态目标分类性能。实验表明,这些模型实现了令人失望的零粒度分类性能,凸显了需要专业方法的需求。最后,我们提出一种新型集成方法,将CLIP和DINOv2的嵌入与降维技术相结合,以提高分类性能。通过整合这些组件,我们的集成方法优于VLMs,有效捕获零售产品鉴别中至关重要的视觉线索。此外,我们引入一种类适应方法,利用有限样本的视觉原型,解决了产品种类频繁变化导致标注数据稀缺的关键需求。在发布MIMEX数据集和基准测试以鼓励进一步研究零样态目标分类用于智能零售应用方面,我们将向研究社区公开。感兴趣的研究者可通过作者获取使用条款和条件的详细信息。代码已公开:https://github.com/AnilOsmanTur/Zero-shot-Retail-Product-Classification。
引用
@article{arxiv.2409.14963,
title = {Exploring Fine-grained Retail Product Discrimination with Zero-shot Object Classification Using Vision-Language Models},
author = {Anil Osman Tur and Alessandro Conti and Cigdem Beyan and Davide Boscaini and Roberto Larcher and Stefano Messelodi and Fabio Poiesi and Elisa Ricci},
journal= {arXiv preprint arXiv:2409.14963},
year = {2024}
}
备注
Accepted at 2024 IEEE 8th Forum on Research and Technologies for Society and Industry Innovation (RTSI) conference