中文

高效零售视频标注:面向产品与客户互动分析的鲁棒关键帧生成方法

计算机视觉与模式识别 2025-06-23 v2 人工智能 人机交互 机器学习

摘要

准确的视频标注在现代零售应用中发挥着关键作用,包括客户行为分析、产品互动检测以及店内活动识别。然而,传统标注方法高度依赖人工标注员进行耗时的手动标注,导致帧选择不够稳健并增加运营成本。为解决零售领域的这些挑战,我们提出了一种基于深度学习的 метод,自动化零售视频中的关键帧识别,并提供产品和客户的自动标注。该方法利用深度神经网络学习判别性特征,通过嵌入视频帧并结合针对零售环境优化的对象检测技术。实验结果表明,我们的方法在准确率上优于传统方法,达到与人工标注相当的水平,同时提高了零售视频标注的整体效率。值得注意的是,我们的方法在视频标注中实现了平均 2 倍的成本节省。通过让人工标注员仅需核查/调整少于 5% 的检测帧,即可完成对剩余帧的自动标注,而不会降低标注质量,从而显著降低零售业的运营成本。关键帧检测的自动化在零售视频标注任务中实现了显著的时间和 effort 节省,对于 diverse 的零售应用(如购物者旅程分析、产品互动检测和店内安全监控)具有重要价值。

关键词

引用

@article{arxiv.2506.14854,
  title  = {Efficient Retail Video Annotation: A Robust Key Frame Generation Approach for Product and Customer Interaction Analysis},
  author = {Varun Mannam and Zhenyu Shi},
  journal= {arXiv preprint arXiv:2506.14854},
  year   = {2025}
}

备注

Submitting to ICCV 2025 workshop: https://retailvisionworkshop.github.io/