TinyFormer:面向 YOLO-DETR 混合实时检测器的微型目标保留方案
摘要
YOLO 系列和 DETR 基于检测器在微型目标检测上存在困难。YOLO 风格模型受益于高效稠密预测,但其大步幅的主干网络可能抑制深层特征图中的微型实例,导致网格分配模糊;DETR 风格模型通过集合预测消除手工后处理,却在粗糙的 token 网格上进行推理,使得微型目标仅占少数弱 token,容易在匹配过程中被忽略。为解决这些问题,本文提出 TinyFormer,一种统一的 YOLO-DETR 混合实时检测器,结合 ViT 表示、无 NMS 的集合预测和 YOLO 风格的金字塔颈部,实现对微型目标的精准检测。TinyFormer 引入平行双流融合模块(Parallel Bi-fusion Module, PBM),从浅层阶段构建高分辨率快捷方式,保留多尺度融合中的细粒度空间细节。我们进一步设计了空间语义适配器(Spatial Semantic Adapter, SSA),补偿粗糙 tokenization 造成的空间损失。SSA 从早期阶段提取高分辨率线索,注入 transformer token 嵌入,提高微型目标定位精度,同时不牺牲 DETR 的全局建模能力。在 MS COCO 上的实验表明,TinyFormer 持续优于最新 YOLO 系列检测器和强大的 DEIMv2 基准。TinyFormer-X 在不使用 PBM 的情况下即可达到 58.4% 的 AP,加入 PBM 后整体 AP 提升至 58.5%,并在小目标上实现 1.6% 的 AP 提升。使用 Objects365 预训练,TinyFormer-X-PBM 达到 60.2% 的 AP,超越了使用更少参数和更低计算量的 RF-DETR 和其他 Objects365 预训练检测器。这些结果表明,TinyFormer 桥接了稠密 YOLO 风格特征融合和 DETR 风格集合预测,为实时微型目标检测提供了强大的精度-效率权衡。代码已公开 https://github.com/mmpmmpmmpjosh/TinyFormer。
引用
@article{arxiv.2605.25046,
title = {TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors},
author = {Jun-Wei Hsieh and Meng-Yu Kao and Ghufron Wahyu Kurniawan and Kuan-Chuan Peng},
journal= {arXiv preprint arXiv:2605.25046},
year = {2026}
}