PRISM: 使用混合匹配进行购物车中的商品检索
计算机视觉与模式识别
2025-09-19 v1
摘要
与传统图像检索任务相比,零售场景中的商品检索更具挑战性。来自不同品牌的同类产品可能具有高度相似的视觉外观,且查询图像的拍摄角度可能与存储目录图像的角度显著不同。基础模型如 CLIP 和 SigLIP 往往难以区分这些微妙但重要的局部差异。另一方面,像素级匹配方法计算代价高昂,且匹配时间过长。在本文中,我们提出了一种新的混合方法 PRISM,用于零售场景中的商品检索,同时利用视觉语言模型和像素级匹配方法的优势。为了同时实现效率/速度与细粒度检索精度,PRISM 包含三个阶段:1)首先使用视觉语言模型(SigLIP)从固定商品库中检索语义最相似的前 35 个商品,从而显著缩小搜索空间;2)应用分割模型(YOLO-E)消除背景杂乱;3)在过滤后的候选商品上使用 LightGlue 进行细粒度像素级匹配。该框架通过关注全局模型常忽略的微妙视觉线索,实现了对高类间相似性商品的更准确区分。在 ABV 数据集上进行的实验表明,我们提出的 PRISM 在 top-1 准确率上超越了最先进的图像检索方法 4.21%,同时仍保持在实际零售部署的实时处理范围内。
引用
@article{arxiv.2509.14985,
title = {PRISM: Product Retrieval In Shopping Carts using Hybrid Matching},
author = {Arda Kabadayi and Senem Velipasalar and Jiajing Chen},
journal= {arXiv preprint arXiv:2509.14985},
year = {2025}
}