中文

YOLO-Former:YOLO 与 ViT 携手

计算机视觉与模式识别 2024-01-15 v1

摘要

所提出的 YOLO-Former 方法无缝集成了 Transformer 与 YOLOv4 的思想,创建了一个高精度且高效的目标检测系统。该方法利用了 YOLOv4 的快速推理速度,并通过整合卷积注意力和 Transformer 模块,吸收了 Transformer 架构的优势。结果证明了所提方法的有效性,在 Pascal VOC 数据集上实现了 85.76% 的平均精度均值(mAP),同时保持了 10.85 帧/秒的高预测速度。这项工作的贡献在于展示了这两种前沿技术的创新结合如何能够推动目标检测领域的进一步改进。

关键词

引用

@article{arxiv.2401.06244,
  title  = {YOLO-Former: YOLO Shakes Hand With ViT},
  author = {Javad Khoramdel and Ahmad Moori and Yasamin Borhani and Armin Ghanbarzadeh and Esmaeil Najafi},
  journal= {arXiv preprint arXiv:2401.06244},
  year   = {2024}
}