YOLO26:综合架构概述与关键改进
计算机视觉与模式识别
2026-02-17 v1
摘要
You Only Look Once (YOLO) 已是深度学习中计算机视觉领域的显要模型已十年之久。本研究探讨了 YOLO26 最新版本的新颖方面。消除 Distribution Focal Loss (DFL),实现 End-to-End NMS-Free 推理,引入 ProgLoss + Small-Target-Aware Label Assignment (STAL),以及采用 MuSGD 优化器,是旨在提高推理速度的若干主要改进,声称可实现 43% 的 CPU 模式速度提升。设计上旨在使 YOLO26 能在边缘设备或无 GPU 设备上实现实时性能。此外,YOLO26 在众多计算机视觉任务中均提供改进,包括实例分割、姿态估计和倾斜边界框 (OBB) 解码。我们力求为此项工作提供的价值超过仅整合既有技术文档中已包含信息。因此,我们对 YOLO26 进行严格的架构调查,主要基于其 GitHub 仓库中提供的源代码及官方文档。YOLO26 的真实与详细操作机制内嵌于源代码中,这在他人手中鲜有提取。YOLO26 架构图即为调查结果。据我们所知,本研究是首次呈现基于 CNN 的 YOLO26 架构,而该架构是 YOLO26 的核心。我们的目标是为研究者与开发者提供 YOLO26 的精确架构理解,确保其继续保持计算机视觉领域领先的深度学习模型地位。
引用
@article{arxiv.2602.14582,
title = {YOLO26: A Comprehensive Architecture Overview and Key Improvements},
author = {Priyanto Hidayatullah and Refdinal Tubagus},
journal= {arXiv preprint arXiv:2602.14582},
year = {2026}
}