中文

基于人体姿态的 Transformer 检测盗窃:Shopformer 框架

计算机视觉与模式识别 2025-04-29 v1

摘要

盗窃仍是零售行业的高额成本问题,但传统的监控系统——主要依赖人工监督——仍大部分无效,仅约有 2% 的盗窃者被捕。现有的 AI 方法依赖像素级视频分析,引发隐私问题,易受环境变化影响,且需要大量计算资源。为此,我们引入 Shopformer,一种新型基于 Transformer 的模型,通过分析姿态序列而非原始视频来检测盗窃。我们提出了自定义的标记化策略,将姿态序列转换为紧凑的嵌入向量,以实现高效的 Transformer 处理。据我们所知,这是首个基于姿态序列的 Transformer 模型用于盗窃检测。我们在真实世界姿态数据上进行评估,方法在状态-of-the-art 异常检测模型之上,提供了一个隐私保护、可扩展的实时零售监控解决方案。本作品的代码基地可在 https://github.com/TeCSAR-UNCC/Shopformer 获取。

关键词

引用

@article{arxiv.2504.19970,
  title  = {Shopformer: Transformer-Based Framework for Detecting Shoplifting via Human Pose},
  author = {Narges Rashvand and Ghazal Alinezhad Noghre and Armin Danesh Pazho and Babak Rahimi Ardabili and Hamed Tabkhi},
  journal= {arXiv preprint arXiv:2504.19970},
  year   = {2025}
}