中文

零样态零售盗窃检测:由编排式视觉模型实现的模型无关、低成本替代方案

计算机视觉与模式识别 2026-04-17 v1 人工智能

摘要

零售盗窃年造成全球经济超过1000亿美元的损失,但现有的AI检测系统需要在专有数据集上进行昂贵的自定义模型训练,并按每家店铺200-500美元/月的高额费用。我们提出Paza,一个零样态零售盗窃检测框架,实现无需训练模型即可进行实际隐蔽检测。我们的方案采用分层管道编排多个现有模型——持续运行廉价目标检测和姿态估计,仅在行为预筛选触发时调用昂贵的视觉语言模型(VLM)。多信号疑似预筛选器(要求停留时间加上至少一个行为信号)将VLM调用次数相对于逐帧分析降低了240倍,最多限制在每分钟10次以下,使单个GPU可服务10-20家店铺。该体系结构是模型无关的:VLM组件接受任何兼容OpenAI的端点,使运营商可以在Gemma 4、Qwen3.5-Omni、GPT-4o或未来版本之间进行切换——无需代码更改,确保系统随着VLM生态的演进而不断改进。我们对VLM组件在DCSASS合成的盗窃数据集(169个片段,受控环境)上进行评估,零样态下实现89.5%精确率和92.8%特异度,召回率59.3%——其中召回率差距可归因于离线评估中稀疏帧采样,而非VLM推理失效,因为精确率和特异度是决定误报率的关键指标。我们详细阐述了成本模型,显示在每家店铺50-100美元(比商业方案贵3-10倍)即可实现可行性,并引入一种隐私保护设计,在检测管道中遮蔽人脸。源代码可在https://github.com/xHaileab/Paza-AI获取。

关键词

引用

@article{arxiv.2604.14846,
  title  = {Zero-Shot Retail Theft Detection via Orchestrated Vision Models: A Model-Agnostic, Cost-Effective Alternative to Trained Single-Model Systems},
  author = {Haileab Yagersew},
  journal= {arXiv preprint arXiv:2604.14846},
  year   = {2026}
}

备注

16 pages, 3 figures, Code to be released at https://github.com/xHaileab/Paza-AI