中文

使用 Faster R-CNN 和 YOLO 网络的协同训练半监督框架用于密集零售图像中的目标检测

计算机视觉与模式识别 2025-09-15 v1 人工智能

摘要

本研究提出了一种用于密集零售环境中目标检测的半监督协同训练框架,其中有限的标注数据和复杂条件构成了主要挑战。该框架结合了 Faster R-CNN(利用 ResNet 主干)进行精确定位和 YOLO(采用 Darknet 主干)获取全局上下文,实现了相互的伪标签交换,提高了存在遮挡和重叠物体的场景中的准确性。为了加强分类,它采用了 XGBoost、Random Forest 和 SVM 的集成,利用多样化的特征表示以获得更高的鲁棒性。使用元启发式驱动算法优化超参数,提高了各模型的精度和效率。通过最小化对手动标注的依赖,该方法降低了标注成本,并有效适应零售中常见的产品和布局的频繁变化。在 SKU-110k 数据集上的实验表现出强大的性能,突显了所提出框架在真实世界零售应用(如自动库存跟踪、产品监控和结账系统)中的可扩展性和实用性。

关键词

引用

@article{arxiv.2509.09750,
  title  = {A Co-Training Semi-Supervised Framework Using Faster R-CNN and YOLO Networks for Object Detection in Densely Packed Retail Images},
  author = {Hossein Yazdanjouei and Arash Mansouri and Mohammad Shokouhifar},
  journal= {arXiv preprint arXiv:2509.09750},
  year   = {2025}
}