中文

YOLO 是否真的需要在每个 epoch 中查看每张训练图像?

计算机视觉与模式识别 2026-03-19 v1

摘要

YOLO 检测器以其快速推理速度著称,但训练过程却意外地耗时,因其详尽的管道在每个 epoch 中处理每张训练图像,即使许多图像已经足够学习。这与「You Only Look Once」的哲学所暗示的效率形成明显对比。这自然提出了一个重要问题:YOLO 是否真的需要在每个 epoch 中查看每张训练图像?为探索此问题,我们提出了反遗忘抽样策略 (AFSS),动态确定在每个 epoch 中应使用哪些图像以及可跳过哪些图像,从而更有效率地学习检测器。具体而言,AFSS 将每张训练图像的学习充分性衡量为其检测召回率和精确率的最小值,并动态将训练图像分为简单、中等或困难三个等级。简单训练图像在持续审查方式下稀疏抽样,优先选择长时间未使用的图像以减少冗余并防止遗忘。中等训练图像部分抽样,优先选择最近未使用的图像,其余随机从未选中的图像中选择以确保覆盖并防止遗忘。困难训练图像在每个 epoch 中完全抽样以确保充分学习。每张训练图像的学习充分性会定期更新,使检测器能够随时间适应性地聚焦于信息丰富的训练图像,同时逐步丢弃冗余图像。在广泛使用的自然图像检测基准 (MS COCO 2017 和 PASCAL VOC 2007) 和遥感检测数据集 (DOTA-v1.0 和 DIOR-R) 上,AFSS 实现了超过 1.43×1.43\times 的训练加速,同时也提升了准确率。

关键词

引用

@article{arxiv.2603.17684,
  title  = {Does YOLO Really Need to See Every Training Image in Every Epoch?},
  author = {Xingxing Xie and Jiahua Dong and Junwei Han and Gong Cheng},
  journal= {arXiv preprint arXiv:2603.17684},
  year   = {2026}
}

备注

Accepted to CVPR 2026