基于开源视觉语言模型的杂货产品检索之关键要素
计算机视觉与模式识别
2026-05-19 v1
摘要
多模态产品检索支撑着无结账零售与自动化库存系统,然而它要求标准视觉语言基准无法捕捉的细粒度 SKU 区分能力。我们对 190 个开源 VLM 在 GroceryVision 挑战赛的 MPR 任务上进行了首次系统性零样本评估,隔离了预训练数据、架构与输入分辨率。我们的分析得出了三项可操作的发现。**(1)数据质量胜过规模。** 从原始网页抓取数据切换到过滤后的数据集可带来高达 16.6% 的准确率提升,超过了将模型参数翻倍带来的收益。**(2)高效模型可以胜出。** MobileCLIP-B(150M 参数)优于在噪声数据上训练的 351M 参数模型。我们引入了语义功率密度(),一种惩罚低于阈值准确率的效率指标。**(3)精度差距持续存在。** 最先进的模型达到了 94.5% 的 Recall@5,但在 Recall@1 上下降了 17.5%,这表明对比嵌入能有效聚类类别,但无法对视觉上相似的 SKU 进行排序。代码与评估脚本可在 \url{https://github.com/upeee/openmpr} 获取。
引用
@article{arxiv.2605.18029,
title = {What Matters for Grocery Product Retrieval with Open Source Vision Language Models},
author = {Emmanuel G. Maminta and Rowel O. Atienza},
journal= {arXiv preprint arXiv:2605.18029},
year = {2026}
}
备注
Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)